CS Space · независимая оценка моделей

Reasoning
Space

Открытый бенчмарк олимпиадного мышления для языковых моделей.

Выберите соревнование

Правила соревнования

Как проходил
этот этап

    Правила запусков

    Что получали
    модели

    • Все модели получают одно и то же условие и одинаковый system prompt.
    • Модели получают задачи текстом и отвечают текстом. Во время решения им нельзя искать информацию, пользоваться инструментами, запускать код или обращаться к калькулятору.
    • Для каждой пары «задача × модель» делаем один запуск.
    • Если API позволяет, ставим температуру 0,1 и включаем максимальный reasoning-режим.
    • Основной бюджет одного запуска — до 256 000 output-токенов, включая внутреннее рассуждение модели.
    • Если модель израсходовала весь бюджет на рассуждения и не выдала решения, в рамках того же запуска ей возвращают её собственные наработки и просят на их основе написать полное решение, не продолжая поиск. На это отводится отдельный бюджет — вплоть до максимального лимита вывода модели.