Just AI обучила отдельную модель, которая ловит обход запретов на русском языке

Команда Just AI из России рассказала, как обучила детектор джейлбрейков для русскоязычных агентов. Джейлбрейк — текст, который заставляет модель обойти собственные ограничения: сыграть роль без правил, разбить опасный вопрос на безобидные шаги или закодировать его.
Детектор входит в продукт Jay Guard и работает как отдельная защитная модель перед основной: она смотрит на входящий запрос и отсекает попытки обхода до того, как их увидит агент.
В статье описаны и сбор данных под русский язык, и бенчмарк для замера — готовых наборов для русскоязычных атак почти нет, и команде пришлось собирать свой.