Переход к вычислениям во время вывода
Десять лет прогресс означал масштабирование обучения. Модели рассуждения поменяли ось: тратим вычисления на этапе вывода, даём модели подумать — и точность растёт на самых трудных задачах.
Вдумчивый разбор свежих статей по машинному обучению — со ссылками на источники, для тех, кто строит на их основе.
Десять лет прогресс означал масштабирование обучения. Модели рассуждения поменяли ось: тратим вычисления на этапе вывода, даём модели подумать — и точность растёт на самых трудных задачах.
Mixture-of-Experts направляет каждый токен в небольшое подмножество специализированных подсетей. Именно эта архитектура тихо стоит за многими крупнейшими открытыми моделями.
Как модель на триллион параметров работает по цене гораздо меньшей.
Главное изменение 2025 года — не более крупная модель, а возможность дольше «думать».
Как модель на триллион параметров работает по цене гораздо меньшей.
Главное изменение 2025 года — не более крупная модель, а возможность дольше «думать».