Разработчики из Zhipu AI представили модель, которая метит в «золотую середину» между легкостью запуска и мощным интеллектом. Архитектура MoE (Mixture of Experts) объемом 30 млрд параметров (из которых активны всего 3 млрд) позволяет деплоить ее даже на домашнем железе без катастрофической потери в качестве ответов.
Главные фишки релиза.
-
Производительность. Модель обходит Qwen3 и GPT-OSS в тестах на логику и программирование.
-
Математика и код. Показатель AIME 25 на уровне 91.6 — это серьезная заявка на доминирование в задачах с рассуждениями.
-
Готовность к работе. Поддержка vLLM и SGLang уже в «мейне», так что возиться с костылями при установке не придется.
Технические детали деплоя. Запуск через Transformers стандартный — используются привычные AutoTokenizer и AutoModelForCausalLM. Благодаря оптимизации под современные фреймворки инференса, модель показывает высокую скорость генерации токенов, что критично для чат-ботов и real-time ассистентов. Фактически это прямой конкурент топовым моделям до 30B, который не требует серверную стойку для работы.












