SWE-Bench Pro: Почему современные ИИ-агенты все еще пасуют перед реальным программированием?

SWE-Bench Pro: Почему современные ИИ-агенты все еще пасуют перед реальным программированием?

AIRouter 4 分钟阅读 1 次浏览

糖果姐姐API服务 的 AI API 使用建议

糖果姐姐API服务 面向需要 OpenAI 兼容接口、Claude/Gemini/GPT 多模型切换、包月额度管理和图像模型调用的用户。阅读本文后,可以结合本站的模型清单、独立使用文档和个人面板,把教程内容直接落到实际调用流程中。

SWE-Bench Pro: Новая планка суровости для ИИ-программистов

В мире искусственного интеллекта наступил момент истины. Долгое время мы наблюдали, как нейросети с легкостью решают алгоритмические задачи и пишут простые скрипты. Однако реальная работа инженера-программиста — это не только написание кода, но и навигация по огромным кодовым базам, исправление багов в сложных архитектурах и соблюдение требований безопасности.

Новый бенчмарк SWE-Bench Pro, представленный Scale Labs, стал холодным душем для индустрии, показав, что путь до полной автоматизации разработки ПО гораздо длиннее, чем казалось.

SWE-Bench Pro Cover

В чем проблема существующих тестов?

Создатели SWE-Bench Pro выделили четыре критические проблемы, которые делали предыдущие тесты (такие как SWE-Bench Verified) слишком «тепличными» для современных LLM:

  1. Загрязнение данных (Data Contamination): Модели обучаются на всем открытом коде из GitHub. Зачастую они не решают задачу, а просто «вспоминают» правильный ответ из обучающей выборки.
  2. Низкая сложность: Большинство тестов фокусируются на простых утилитах, игнорируя сложные B2B-системы и потребительские приложения.
  3. Излишняя упрощенность: Из бенчмарков часто удаляют двусмысленные задачи, хотя именно с ними чаще всего сталкивается живой разработчик.
  4. Ненадежность окружения: Проблемы с настройкой Docker-контейнеров часто приводили к тому, что корректные решения ИИ не засчитывались.

Анатомия SWE-Bench Pro

SWE-Bench Pro — это 1865 задач из 41 профессионального репозитория. Весь датасет разделен на три части:

  • Public Set (731 задача): Используются репозитории с лицензией copyleft (GPL). Это юридический барьер: компании редко включают такой код в закрытые датасеты для обучения, что снижает риск «зубрежки».
  • Private Set (276 задач): Настоящий «экзамен» на закрытом проприетарном коде стартапов-партнеров. Эти данные гарантированно не встречались ИИ при обучении.
  • Held-out Set (858 задач): Закрытая часть для будущих оценок.

Методология создания задач

Каждая задача проходит жесткий цикл подготовки:

  1. Sourcing: Выбор качественных репозиториев.
  2. Environment Creation: Профессиональные инженеры создают Docker-окружение, где код работает «из коробки».
  3. Harvesting: Поиск реальных коммитов, которые исправляют баги или добавляют функции.
  4. Augmentation: Эксперты-люди уточняют описание задачи, чтобы ИИ понимал, что нужно сделать, но не получал прямых подсказок по реализации.

Результаты: От триумфа к реальности

Самое шокирующее в результатах SWE-Bench Pro — это колоссальный разрыв в производительности по сравнению с предыдущими версиями теста. Если на SWE-Bench Verified топовые модели показывали результат выше 70%, то на SWE-Bench Pro лидеры едва преодолевают порог в 23%.

Ключевые выводы исследования:

  • Сложность имеет значение: Чем больше файлов нужно изменить и чем больше строк кода добавить, тем хуже справляется ИИ. На сложных задачах результативность падает по экспоненте.
  • Языковой барьер: Задачи на Go и Python решаются значительно лучше (до 30%), в то время как JavaScript и TypeScript вызывают у моделей серьезные затруднения.
  • Приватный код — это боль: На задачах из закрытых репозиториев (Private Set) эффективность GPT-5 упала с 23.1% до 14.9%. Это доказывает, что модели во многом полагаются на память, а не на логическое мышление.

Лидеры индустрии

Несмотря на общую сложность, на горизонте появились новые фавориты. На текущий момент (согласно публичному лидерборду) ситуация выглядит следующим образом:

  • Muse Spark 1.1: Лидер с результатом 61.5% (при использовании специализированных агентов).
  • GPT-5.4 (xHigh): Уверенное второе место с 59.1%.
  • Claude Opus 4.6: Замыкает тройку с результатом около 51.9%.

Важно отметить, что старые модели, такие как GPT-4o, показывают катастрофически низкие результаты — всего 4.9%. Это подчеркивает, какой огромный скачок совершили «рассуждающие» (reasoning) модели последнего поколения.

Что это значит для будущего?

SWE-Bench Pro доказывает: мы еще не готовы заменить программистов на ИИ. Реальная разработка требует долгосрочного планирования и глубокого понимания контекста, чего текущим моделям пока не хватает.

Однако появление таких жестких бенчмарков — это благо. Они заставляют разработчиков ИИ фокусироваться на реальном решении проблем, а не на подгонке ответов под известные тесты. Мы переходим от эры «умных чат-ботов» к эре настоящих автономных программных инженеров.


Хотите узнать больше о том, как работают современные ИИ-агенты? Подписывайтесь на наши обновления!