Обновлено 21 июля 2026
49% на SWE-bench: минимальный агент с bash и редактором

Обновлённый Claude 3.5 Sonnet набрал 49% на SWE-bench Verified — на 4 п.п. выше прежнего рекорда. Anthropic разобрала, как устроен агент вокруг модели: не тест «в вакууме», а связка с промптом, разбором ответов и циклом действий.
Минимальный каркас
Максимум контроля у модели, минимум жёсткой обвязки. Промпт намечает шаги — изучить репозиторий, воспроизвести баг, поправить код, перепроверить — но фиксированного конвейера нет. Цикл крутится, пока модель не решит, что задача закрыта, или пока не упрётся в лимит контекста 200k токенов.
Два инструмента
- Bash Tool — shell-команды; в описании прописаны ограничения: без интернета, зеркала apt и pip, подсказки по фоновым процессам.
- Edit Tool (
str_replace_editor) — просмотр, создание и правка файлов; замена черезold_strиnew_strсрабатывает только при единственном совпадении.
Пути к файлам сделали только абсолютными — относительные часто ломались после смены рабочей директории. Описания тулов тестировали на типичных ошибках понимания; авторы сравнивают это с проектированием интерфейсов для людей.
На бенчмарке агент получает Python-окружение и снимок кода до фикса GitHub issue из open-source репозиториев; успех сверяют с юнит-тестами из оригинального pull request. Подвыборка Verified — 500 задач, которые люди вручную проверили на решаемость. Код собирали на базе SWE-Agent: на той же обвязке старый Claude 3.5 Sonnet давал 33%, Claude 3 Opus — 22%; до отметки в 50% пока никто не дошёл.
Источник: Raising the bar on SWE-bench Verified with Claude 3.5 Sonnet.