#pretraining
- Модели генерации видео как универсальные инструменты компьютерного зрения Google DeepMind research
- Статья ByteDance Seed исследует, как часто высококачественные доменные данные следует повторять при масштабировании LLM ByteDance research
- Яндекс открыл Alice AI Search Pretrain — базовую модель AI-ответов в Поиске Yandex models-llm
- NCP-ArchPreview: латентные языковые модели на 8,9B параметров через Next Concept Prediction Shanghai AI Lab research
- Масштабируемое визуальное предобучение для языкового интеллекта research
- SMELT: зацикленные MoE-трансформеры догоняют базовое масштабирование при равных вычислениях ByteDance Seed research
- Понимание рассуждения: от предобучения к пост-обучению research
- К «физике» мультимодального предобучения: поток знаний, синергия модальностей, ранняя унификация и рецепты Meta AI research