RUVDS открыла тест художественного перевода — сто ловушек в одном рассказе

Команда RUVDS выложила бенчмарк художественного англо-русского перевода и встроила его в открытый конвейер BookTrans. Внутри один рассказ со ста расставленными ловушками — местами, где легко ошибиться с идиомой, родом или реалией.
Оценивает модель-судья с ключом ответов, баллы считает код, а не человек. На наборе прогнали флагманские модели Anthropic, OpenAI и Google против китайских.
Бенчмарк опубликован вместе с конвейером, так что прогон можно повторить на своих моделях.