Домашняя страница
/

Проект

Многоязычный бенчмарк

Для объективной оценки кодовых ассистентов

О проекте

О проекте

О проекте

Современные кодовые LLM показывают высокие результаты в публичных тестах, однако такие оценки не всегда отражают их реальную способность решать инженерные задачи. Многие существующие бенчмарки ограничены одним языком программирования, содержат шум в разметке или частично попадают в обучающие данные моделей.

Наша цель — создать независимый многоязычный бенчмарк, который позволит честно сравнивать возможности AI-агентов на реальных задачах разработки: исправлении ошибок, изменении API и улучшении существующего кода.

РЕШЕНИЕ

РЕШЕНИЕ

РЕШЕНИЕ

Мы разработали расширенную версию SWE-Bench Verified с поддержкой нескольких языков программирования и более строгими требованиями к качеству данных.

В основу датасета вошли пары issue и merge request из открытых и закрытых репозиториев. Для отбора задач мы использовали набор автоматических и экспертных проверок: анализировали объем изменений в коде, соответствие между описанием проблемы и итоговым исправлением, качество тестов и сложность задачи.

В итоговый бенчмарк вошли задачи на C#, C++, Go, Java, JavaScript, Kotlin, PHP, Ruby, Rust, Scala и TypeScript. Дополнительно для каждого кейса подготовили сервисные файлы и окружение, необходимые для автоматического воспроизведения задачи и оценки решений AI-агентов.

red teaming

РЕЗУЛЬТАТ

РЕЗУЛЬТАТ

РЕЗУЛЬТАТ

Мы собрали один из крупнейших многоязычных датасетов для оценки кодовых LLM: более 7500 пар issue / merge request прошли разметку, из которых 1500 задач соответствуют строгим критериям качества и вошли в финальный бенчмарк.

Новый датасет позволяет объективно измерять возможности кодовых ассистентов в сценариях, приближенных к реальной промышленной разработке. Тестирование ведущих открытых и коммерческих моделей показало, что даже современные LLM испытывают сложности при работе с многокомпонентными изменениями в существующих кодовых базах, что делает качественные SWE-бенчмарки критически важным инструментом развития AI-разработки.

red teaming

РЕАЛИЗАЦИЯ

РЕАЛИЗАЦИЯ

РЕАЛИЗАЦИЯ

Для подготовки датасета мы построили многоступенчатый пайплайн отбора и валидации данных.

На первом этапе собрали пары issue и merge request из различных репозиториев. Затем провели проверку соответствия описания issue реальному исправлению, оценили качество патчей, тестового покрытия и сложность задачи.

Для воспроизводимого тестирования подготовили дополнительную инфраструктуру: конфигурации окружения, сервисные файлы и автоматизированные сценарии проверки решений.

Оценку моделей проводили через агентный фреймворк harbor от создателей Terminal Bench и систему multi-swe-bench, которые позволили автоматически применять сгенерированные патчи к репозиториям, запускать тесты и измерять качество решений.

Давайте работать вместе!

Прикрепить файл