Домашняя страница
/

Проект

Датасет олимпиадных математических задач

Русифицированный датасет для обучения, файнтюнинга и оценки LLM

О проекте

О проекте

О проекте

Развивать математические способности языковых моделей сложно без качественных данных. При этом в русскоязычном сегменте почти нет крупных датасетов олимпиадного уровня, которые помогают моделям учиться сложным рассуждениям, понимать математический контекст и работать с нестандартными задачами. Такие датасеты важны не только для оценки математических навыков, но и для проверки общего уровня reasoning — способности модели выстраивать логические цепочки и делать обоснованные выводы.

ЗАДАЧА

ЗАДАЧА

ЗАДАЧА

Перед командой стояла цель — создать надежный русскоязычный корпус задач AIME, сохранить точность математических формул, структуру оригинальных материалов и подготовить данные для работы с современными LLM.

datasets

РЕШЕНИЕ

РЕШЕНИЕ

РЕШЕНИЕ

Мы разработали полный пайплайн по сбору, обработке, переводу и адаптации задач American Invitational Mathematics Examination (AIME).

В качестве источника использовали архив Art of Problems Solving (AoPS), содержащий задачи соревнований с 1983 по 2025 годы. Автоматизированный Python-пайплайн собрал условия, решения, ответы и метаданные задач, сохранив математическую нотацию LaTeX и структуру исходных материалов.

Для перевода корпуса на русский язык реализовали автоматизированный процесс с использованием модели DeepSeek Reasoner через API. Специально разработанные промпты позволили сохранить математические выражения, форматирование и терминологическую точность.

На финальном этапе данные были преобразованы в машиночитаемый формат, подходящий для обучения и оценки языковых моделей: задачи были разделены на тестовый набор и few-shot примеры, дополнены метаданными, категориями и вариантами решений.

datasets

РЕЗУЛЬТАТ

РЕЗУЛЬТАТ

РЕЗУЛЬТАТ

Мы создали ruAIME — русскоязычный датасет олимпиадных математических задач с оригинальными английскими версиями, переводами, решениями и метаданными.

Датасет можно использовать для:

  • обучения и тонкой настройки математических языковых моделей;
  • оценки способности моделей к сложным логическим рассуждениям;
  • создания образовательных AI-продуктов и интеллектуальных помощников;
  • проведения исследований в области кросс-лингвистического машинного обучения.

Для проверки качества датасета мы провели тестирование модели DeepSeek Reasoner через фреймворк lm-evaluation-harness. В тестах на русскоязычном наборе задач модель достигла точности около 70%, подтвердив возможность эффективного использования датасета для оценки математических возможностей современных LLM.

РЕАЛИЗАЦИЯ

РЕАЛИЗАЦИЯ

РЕАЛИЗАЦИЯ

Ключевой особенностью проекта стала разработка полностью автоматизированного пайплайна подготовки данных:парсинг и извлечение задач из веб-архива AoPS;

  • обработка HTML-контента и сохранение математической разметки LaTeX;
  • автоматическое извлечение ответов и решений;
  • очистка данных, поиск дубликатов и контроль качества датасета;
  • перевод корпуса с помощью LLM через API;
  • структурирование данных в форматах Parquet и JSON;
  • подготовка тестовых наборов для использования в lm-evaluation-harness.

Дополнительно провели статистический анализ датасета: проверили распределение ответов, тематический баланс задач, отсутствие значимых аномалий и дубликатов. Анализ показал высокое качество и репрезентативность корпуса для задач машинного обучения.

table

Давайте работать вместе!

Прикрепить файл