Зачем тестировать локальные MoE-модели

Архитектура Mixture of Experts (MoE) перестала быть уделом только гигантских серверных моделей. Современные локальные сборки умеют активировать лишь часть параметров при каждом запросе, поэтому они быстрее и легче классических монолитов при сопоставимом качестве. Вопрос в другом: насколько такие модели реально справляются с практическими задачами, а не только с синтетическими бенчмарками.

Как проходил эксперимент

Автор теста подошёл к делу нестандартно: вместо абстрактных вопросов он предложил моделям написать три браузерные игры на HTML, CSS и JavaScript — «Мастермайнд», тетрис и танки. Такой формат удобен тем, что результат виден сразу: никаких компиляций, запустил файл в браузере — и всё понятно. Все модели получили одинаковые промпты, поэтому сравнение получилось честным.

В тесте участвовали десять моделей, многие из которых дообучены на базе Qwen:

  • Qwen 3.6 (MTP), KAT Coder V2.5, Gemma 4;
  • Aurora-Code-1, Frontis, GLM 4.7 Flash;
  • Ornith 1.0, Salience 1.5 Pro, Agents A1;
  • GPT-oss 20b — единственная модель с открытыми весами от OpenAI.

Результаты: топ не подвёл, но сюрпризы были

Итоговый рейтинг считался по пяти критериям: геймплей, мобильная адаптация, визуал, стабильность и эффективность. Первое место ожидаемо занял Qwen 3.6 (MTP) с 87 баллами — модель выдает около 37-40 токенов в секунду благодаря поддержке multi-token prediction. Второе место у KAT Coder V2.5 (80 баллов), третье — у Gemma 4 (71 балл).

Самый интересный вывод: даже модели, которые по карточкам на Hugging Face обгоняют своего «учителя», в реальных задачах часто уступают оригиналу. Дообучение на кодинге не гарантирует победы на практике. Разрыв между лидерами и аутсайдерами огромен: GPT-oss 20b набрал всего 34 балла.

Технические детали запуска

Тестирование шло на ПК с RTX 3070 (8 ГБ видеопамяти) и Ryzen 9 5950X через свежую сборку llama.cpp. Ключевой момент — флаг -cmoe, переносящий часть слоёв в оперативную память: модели весом более 20 ГБ запускаются даже на карте с 8 ГБ, хотя скорость падает: 25-28 токенов в секунду против 37-40 у лидера.

Выводы

Год назад ни одна локальная модель не могла собрать рабочую игру за один промпт — это удавалось только серверным гигантам вроде Claude. Сегодня с выходом свежих MoE-сборок задача решается на домашнем ПК на комфортных скоростях. Методика автора субъективна, часть моделей теряла эффективность при повторных прогонах, но главное подтверждено: локальные MoE-модели уже готовы к реальной работе с кодом.