Проект
О проекте
О проекте
О проекте
Современные кодовые LLM показывают высокие результаты в публичных тестах, однако такие оценки не всегда отражают их реальную способность решать инженерные задачи. Многие существующие бенчмарки ограничены одним языком программирования, содержат шум в разметке или частично попадают в обучающие данные моделей.
Наша цель — создать независимый многоязычный бенчмарк, который позволит честно сравнивать возможности AI-агентов на реальных задачах разработки: исправлении ошибок, изменении API и улучшении существующего кода.
РЕШЕНИЕ
РЕШЕНИЕ
РЕШЕНИЕ
Мы разработали расширенную версию SWE-Bench Verified с поддержкой нескольких языков программирования и более строгими требованиями к качеству данных.
В основу датасета вошли пары issue и merge request из открытых и закрытых репозиториев. Для отбора задач мы использовали набор автоматических и экспертных проверок: анализировали объем изменений в коде, соответствие между описанием проблемы и итоговым исправлением, качество тестов и сложность задачи.
В итоговый бенчмарк вошли задачи на C#, C++, Go, Java, JavaScript, Kotlin, PHP, Ruby, Rust, Scala и TypeScript. Дополнительно для каждого кейса подготовили сервисные файлы и окружение, необходимые для автоматического воспроизведения задачи и оценки решений AI-агентов.

РЕЗУЛЬТАТ
РЕЗУЛЬТАТ
РЕЗУЛЬТАТ
Мы собрали один из крупнейших многоязычных датасетов для оценки кодовых LLM: более 7500 пар issue / merge request прошли разметку, из которых 1500 задач соответствуют строгим критериям качества и вошли в финальный бенчмарк.
Новый датасет позволяет объективно измерять возможности кодовых ассистентов в сценариях, приближенных к реальной промышленной разработке. Тестирование ведущих открытых и коммерческих моделей показало, что даже современные LLM испытывают сложности при работе с многокомпонентными изменениями в существующих кодовых базах, что делает качественные SWE-бенчмарки критически важным инструментом развития AI-разработки.

РЕАЛИЗАЦИЯ
РЕАЛИЗАЦИЯ
РЕАЛИЗАЦИЯ
Для подготовки датасета мы построили многоступенчатый пайплайн отбора и валидации данных.
На первом этапе собрали пары issue и merge request из различных репозиториев. Затем провели проверку соответствия описания issue реальному исправлению, оценили качество патчей, тестового покрытия и сложность задачи.
Для воспроизводимого тестирования подготовили дополнительную инфраструктуру: конфигурации окружения, сервисные файлы и автоматизированные сценарии проверки решений.
Оценку моделей проводили через агентный фреймворк harbor от создателей Terminal Bench и систему multi-swe-bench, которые позволили автоматически применять сгенерированные патчи к репозиториям, запускать тесты и измерять качество решений.







