CS Space · независимая оценка моделей
Reasoning
Space
Открытый бенчмарк олимпиадного мышления для языковых моделей.
Выберите соревнование
Правила соревнования
Как проходил
этот этап
Правила запусков
Что получали
модели
- Все модели получают одно и то же условие и одинаковый system prompt.
- Модели получают задачи текстом и отвечают текстом. Во время решения им нельзя искать информацию, пользоваться инструментами, запускать код или обращаться к калькулятору.
- Для каждой пары «задача × модель» делаем один запуск.
- Если API позволяет, ставим температуру 0,1 и включаем максимальный reasoning-режим.
- Основной бюджет одного запуска — до 256 000 output-токенов, включая внутреннее рассуждение модели.
- Если модель израсходовала весь бюджет на рассуждения и не выдала решения, в рамках того же запуска ей возвращают её собственные наработки и просят на их основе написать полное решение, не продолжая поиск. На это отводится отдельный бюджет — вплоть до максимального лимита вывода модели.