Last Translation Benchmark: авторские задачи людей, которые всё ещё ломают frontier-модели перевода
Большой консорциум (Vilem Zouhar, Niyati Bafna, Stella Biderman и другие) выпускает LTBv1 — живую коллекцию созданных людьми и прошедших рецензирование текстов, изображений, аудио и видео, на которых ломаются ведущие системы машинного перевода, пока стандартные бенчмарки насыщаются. Каждый пример снабжён вручную составленными правилами верификации, описывающими конкретные режимы отказа, что даёт надёжную, устойчивую к reward hacking и действенную оценку.
Почему это важно
Ненасыщенная, поддерживаемая сообществом оценка с верификацией по правилам — шаблон постнасыщенного бенчмаркинга за пределами машинного перевода.
Важность: 2/5
Заметный релиз бенчмарка от сообщества
Источники
официальный
Last Translation Benchmark (arXiv)