Парадокс нынешнего рынка ИИ для программирования: лидеры показывают почти одинаковые цифры. Четыре топовые модели выдают 95–96% на SWE-bench Verified — разница в пределах погрешности, а вот цены и доступность отличаются в десятки раз.

SWE-bench Verified — это набор из 500 настоящих багов с GitHub. Модель получает описание проблемы и должна написать патч, который пройдёт тесты проекта. Никаких задачек с LeetCode: реальные репозитории с чужим кодом и зависимостями. Весной тест насытился — весь топ застрял в коридоре 95–96%, и внимание переключилось на SWE-bench Pro: 1865 задач из 41 репозитория на разных языках. Там уже видно, кто просто хорошо пишет функции, а кто разбирается в большой кодовой базе.

Если коротко, расклад такой. Anthropic выкатила Claude Opus 5 по цене прошлого поколения: 5 долларов за входящий и 25 за исходящий миллион токенов, 96% на Verified и 79,2% на Pro. Это самый практичный вариант — обычный API без листов ожидания. Модели Mythos-класса берут 80% на Pro, но стоят вдвое дороже, а Mythos 5 закрыт для сотни партнёров программы Glasswing. GPT-5.6 Sol красиво лидирует по цифрам, 96,2%, только OpenAI их не подтвердила, а доступ есть у пары десятков команд.

Среди открытых моделей сильнее всех GLM-5.2 от Zhipu: 62,1% на Pro, MIT-лицензия, обучение на чипах Huawei Ascend. API стоит копейки, но на одну задачу модель сжигает 43 тысячи выходных токенов против 16 тысяч у конкурентов — за реальную работу выходит почти как за флагманы. Зато веса можно скачать и развернуть у себя: для команд с жёсткими требованиями к хранению кода это перевешивает любую экономию.

Самое разумное соотношение цены и качества — у DeepSeek V4-Pro и Gemini 3.1 Pro: по 80,6% на Verified за 1,74–2 доллара за миллион токенов. Для ревью кода и генерации тестов этого хватает с запасом.

Кстати, динамика любопытная. В марте 2025 года лидер набирал около 49%, в январе 2026 — уже 78%, а к лету тест просто перестал разделять модели. Бенчмарки устаревают быстрее, чем выходят новые версии, поэтому достаточно раз в квартал пересматривать расклад и смотреть, не появилась ли модель с доступным API, которая закрывает 80% задач за меньшие деньги.

По сути, выбор сместился с вопроса «кто умнее» на вопрос «кого я могу купить и сколько это стоит за реальную задачу». Если нет доступа к API западных вендоров — открытые веса DeepSeek или GLM остаются единственным рабочим вариантом, а тем, кому код нужно держать внутри периметра, self-hosted модели выигрывают у облака независимо от бенчмарков.