Last Translation Benchmark: авторские задачи людей, которые всё ещё ломают frontier-модели перевода

исследования официальный 2 ист. ~1 мин

Большой консорциум (Vilem Zouhar, Niyati Bafna, Stella Biderman и другие) выпускает LTBv1 — живую коллекцию созданных людьми и прошедших рецензирование текстов, изображений, аудио и видео, на которых ломаются ведущие системы машинного перевода, пока стандартные бенчмарки насыщаются. Каждый пример снабжён вручную составленными правилами верификации, описывающими конкретные режимы отказа, что даёт надёжную, устойчивую к reward hacking и действенную оценку.

Почему это важно

Ненасыщенная, поддерживаемая сообществом оценка с верификацией по правилам — шаблон постнасыщенного бенчмаркинга за пределами машинного перевода.

Важность: 2/5

Заметный релиз бенчмарка от сообщества

Источники

официальный Last Translation Benchmark (arXiv)
вторичный Last Translation Benchmark — Hugging Face Daily Papers (syndicated from arXiv)