Transformers v5.16.0: гибридное внимание Qwen4-Exp, ESMC + ESMFold2; поддержка GLM 5.3 Flash в v5.16.1

Hugging Face

инструменты официальный 2 ист. ~1 мин

v5.16.0 (26 авг.) добавляет гибридное sparse+linear внимание Qwen4-Exp, GraniteSpeech5 (~470M conformer-энкодер для ASR), Step3p7 (198B sparse MoE VLM), CohereCompass base для малых VLM Cohere, модели белкового языка/фолдинга ESMC и ESMFold2 от BioHub. v5.16.1 добавляет поддержку GLM 5.3 Flash (320B суммарно / 18B активных, первая нативно мультимодальная модель GLM-5). Ломающее изменение: legacy-реализация tensor-parallel заменена на нативный DTensor-бэкенд.

Почему это важно

Гибридная архитектура Qwen4-Exp становится first-class в референсной реализации; переход только на DTensor TP заставляет downstream-код обновляться, но открывает более чистые параллелизм-стеки.

Важность: 2/5

default

Источники

официальный Transformers v5.16.0 release
официальный Transformers v5.16.1 release