Тест локальных MoE-моделей: кто реально умеет писать код
Зачем тестировать локальные MoE-модели
Архитектура Mixture of Experts (MoE) перестала быть уделом только гигантских серверных моделей. Современные локальные сборки умеют активировать лишь часть параметров при каждом запросе, поэтому они быстрее и легче классических монолитов при сопоставимом качестве. Вопрос в другом: насколько такие модели реально справляются с практическими задачами, а не только с синтетическими бенчмарками.
Как проходил эксперимент
Автор теста подошёл к делу нестандартно: вместо абстрактных вопросов он предложил моделям написать три браузерные игры на HTML, CSS и JavaScript — «Мастермайнд», тетрис и танки. Такой формат удобен тем, что результат виден сразу: никаких компиляций, запустил файл в браузере — и всё понятно. Все модели получили одинаковые промпты, поэтому сравнение получилось честным.
В тесте участвовали десять моделей, многие из которых дообучены на базе Qwen:
- Qwen 3.6 (MTP), KAT Coder V2.5, Gemma 4;
- Aurora-Code-1, Frontis, GLM 4.7 Flash;
- Ornith 1.0, Salience 1.5 Pro, Agents A1;
- GPT-oss 20b — единственная модель с открытыми весами от OpenAI.
Результаты: топ не подвёл, но сюрпризы были
Итоговый рейтинг считался по пяти критериям: геймплей, мобильная адаптация, визуал, стабильность и эффективность. Первое место ожидаемо занял Qwen 3.6 (MTP) с 87 баллами — модель выдает около 37-40 токенов в секунду благодаря поддержке multi-token prediction. Второе место у KAT Coder V2.5 (80 баллов), третье — у Gemma 4 (71 балл).
Самый интересный вывод: даже модели, которые по карточкам на Hugging Face обгоняют своего «учителя», в реальных задачах часто уступают оригиналу. Дообучение на кодинге не гарантирует победы на практике. Разрыв между лидерами и аутсайдерами огромен: GPT-oss 20b набрал всего 34 балла.
Технические детали запуска
Тестирование шло на ПК с RTX 3070 (8 ГБ видеопамяти) и Ryzen 9 5950X через свежую сборку llama.cpp. Ключевой момент — флаг -cmoe, переносящий часть слоёв в оперативную память: модели весом более 20 ГБ запускаются даже на карте с 8 ГБ, хотя скорость падает: 25-28 токенов в секунду против 37-40 у лидера.
Выводы
Год назад ни одна локальная модель не могла собрать рабочую игру за один промпт — это удавалось только серверным гигантам вроде Claude. Сегодня с выходом свежих MoE-сборок задача решается на домашнем ПК на комфортных скоростях. Методика автора субъективна, часть моделей теряла эффективность при повторных прогонах, но главное подтверждено: локальные MoE-модели уже готовы к реальной работе с кодом.
Интересно, а какой минимальный объём видеопамяти нужен, чтобы эти десять моделей запустить локально? У меня всего 8 гигабайт, и хочется понять, что из списка вообще реально потянуть.
@Алексей Волков, с 8 гигабайтами вы как раз на границе — в статье не указано, на каком железе гоняли модели. А то, что модель собрала тетрис по промпту, ещё не значит, что она потянет реальный проект.
@Дмитрий, справедливо. У MoE-моделей при каждом запросе активируется лишь часть параметров, так что на 8 гигабайтах что-то из списка реально поднять, если собрать с квантованием. А вот на каком железе гоняли сами авторы — нигде не указано, а это ключевая деталь.