Главная страница » Блог » Технологические новости​ » GLM-4.7-Flash — новый король среди компактных моделей

GLM-4.7-Flash — новый король среди компактных моделей

Разработчики из Zhipu AI представили модель, которая метит в «золотую середину» между легкостью запуска и мощным интеллектом. Архитектура MoE (Mixture of Experts) объемом 30 млрд параметров (из которых активны всего 3 млрд) позволяет деплоить ее даже на домашнем железе без катастрофической потери в качестве ответов.

Главные фишки релиза.

  • Производительность. Модель обходит Qwen3 и GPT-OSS в тестах на логику и программирование.

  • Математика и код. Показатель AIME 25 на уровне 91.6 — это серьезная заявка на доминирование в задачах с рассуждениями.

  • Готовность к работе. Поддержка vLLM и SGLang уже в «мейне», так что возиться с костылями при установке не придется.

Технические детали деплоя. Запуск через Transformers стандартный — используются привычные AutoTokenizer и AutoModelForCausalLM. Благодаря оптимизации под современные фреймворки инференса, модель показывает высокую скорость генерации токенов, что критично для чат-ботов и real-time ассистентов. Фактически это прямой конкурент топовым моделям до 30B, который не требует серверную стойку для работы.

Оставьте комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Прокрутить вверх