Transformers v5.16.0: гибридное внимание Qwen4-Exp, ESMC + ESMFold2; поддержка GLM 5.3 Flash в v5.16.1
Hugging Face
v5.16.0 (26 авг.) добавляет гибридное sparse+linear внимание Qwen4-Exp, GraniteSpeech5 (~470M conformer-энкодер для ASR), Step3p7 (198B sparse MoE VLM), CohereCompass base для малых VLM Cohere, модели белкового языка/фолдинга ESMC и ESMFold2 от BioHub. v5.16.1 добавляет поддержку GLM 5.3 Flash (320B суммарно / 18B активных, первая нативно мультимодальная модель GLM-5). Ломающее изменение: legacy-реализация tensor-parallel заменена на нативный DTensor-бэкенд.
Почему это важно
Гибридная архитектура Qwen4-Exp становится first-class в референсной реализации; переход только на DTensor TP заставляет downstream-код обновляться, но открывает более чистые параллелизм-стеки.
Важность: 2/5
default
Источники
официальный
Transformers v5.16.0 release
официальный
Transformers v5.16.1 release