ИИ для кода упёрся в потолок: на что смотреть вместо бенчмарков
Парадокс нынешнего рынка ИИ для программирования: лидеры показывают почти одинаковые цифры. Четыре топовые модели выдают 95–96% на SWE-bench Verified — разница в пределах погрешности, а вот цены и доступность отличаются в десятки раз.
SWE-bench Verified — это набор из 500 настоящих багов с GitHub. Модель получает описание проблемы и должна написать патч, который пройдёт тесты проекта. Никаких задачек с LeetCode: реальные репозитории с чужим кодом и зависимостями. Весной тест насытился — весь топ застрял в коридоре 95–96%, и внимание переключилось на SWE-bench Pro: 1865 задач из 41 репозитория на разных языках. Там уже видно, кто просто хорошо пишет функции, а кто разбирается в большой кодовой базе.
Если коротко, расклад такой. Anthropic выкатила Claude Opus 5 по цене прошлого поколения: 5 долларов за входящий и 25 за исходящий миллион токенов, 96% на Verified и 79,2% на Pro. Это самый практичный вариант — обычный API без листов ожидания. Модели Mythos-класса берут 80% на Pro, но стоят вдвое дороже, а Mythos 5 закрыт для сотни партнёров программы Glasswing. GPT-5.6 Sol красиво лидирует по цифрам, 96,2%, только OpenAI их не подтвердила, а доступ есть у пары десятков команд.
Среди открытых моделей сильнее всех GLM-5.2 от Zhipu: 62,1% на Pro, MIT-лицензия, обучение на чипах Huawei Ascend. API стоит копейки, но на одну задачу модель сжигает 43 тысячи выходных токенов против 16 тысяч у конкурентов — за реальную работу выходит почти как за флагманы. Зато веса можно скачать и развернуть у себя: для команд с жёсткими требованиями к хранению кода это перевешивает любую экономию.
Самое разумное соотношение цены и качества — у DeepSeek V4-Pro и Gemini 3.1 Pro: по 80,6% на Verified за 1,74–2 доллара за миллион токенов. Для ревью кода и генерации тестов этого хватает с запасом.
Кстати, динамика любопытная. В марте 2025 года лидер набирал около 49%, в январе 2026 — уже 78%, а к лету тест просто перестал разделять модели. Бенчмарки устаревают быстрее, чем выходят новые версии, поэтому достаточно раз в квартал пересматривать расклад и смотреть, не появилась ли модель с доступным API, которая закрывает 80% задач за меньшие деньги.
По сути, выбор сместился с вопроса «кто умнее» на вопрос «кого я могу купить и сколько это стоит за реальную задачу». Если нет доступа к API западных вендоров — открытые веса DeepSeek или GLM остаются единственным рабочим вариантом, а тем, кому код нужно держать внутри периметра, self-hosted модели выигрывают у облака независимо от бенчмарков.
Показательно, что весь топ застрял в коридоре 95–96%: похоже, SWE-bench Verified насытился, и разница между моделями уже в пределах шума. А вот на Pro разброс заметно больше, и это уже больше похоже на реальную картину. Только хотелось бы понять, насколько выборка из 41 репозитория вообще отражает то, с чем сталкиваешься в обычном продакшене.
Интересно, как именно считали 79,2% на SWE-bench Pro: один прогон на задачу или несколько попыток с выбором лучшего патча? От этого цифра сильно зависит, как и от того, дают ли модели доступ к запуску тестов в цикле. И во сколько в итоге обходится один решённый кейс, если считать все итерации по ценам Opus 5?
@Алексей Волков, насчёт методики согласен: без уточнения про число попыток цифры на SWE-bench мало о чём говорят. Меня больше смущает, что ни Opus 5, ни Mythos локально не запустить, так что проверить эти 79,2% на своей кодовой базе не выйдет. Хорошо бы в таких обзорах рядом с закрытыми моделями ставить хотя бы одну открытую с теми же условиями прогона.
@Игорь, согласен, локально не проверить.
Показательно, что при 95-96% на Verified разница между лидерами укладывается в погрешность: такой бенчмарк уже почти ничего не говорит о качестве. Вопрос, насколько Pro-результаты воспроизводимы — 79,2% у Opus 5 это один удачный прогон или усреднение? Хотелось бы увидеть независимую проверку, а не только цифры из анонсов.
А 62,1% у GLM-5.2 на Pro — это тот же набор из 41 репозитория, что и у остальных, или у открытых моделей своя методика прогона? И насколько такой разрыв с Opus 5 ощущается на реальных задачах, а не только на бенчмарке.
Пользуюсь ИИ-ассистентом для кода почти каждый день, и правда, последние обновления уже не дают такого скачка, как год назад. Хорошо, что теперь сравнивают на реальных задачах, а не только на процентах в бенчмарке.
Интересный момент про 43 тысячи токенов у GLM: у нас на реальных задачах разница в расходе между моделями часто перекрывает разницу в цене за токен. Держим связку — дешёвая модель для рутины, дорогая для сложных рефакторингов, и по факту бюджет выходит почти одинаковый. А по поводу насыщения Verified согласен: на багах из своего репозитория результаты куда разбросаннее, чем в тесте.