hubris

Как мы сравниваем модели

Правила одни для всех пар и считаются кодом — руками очки не правятся. Три источника: карточки поставщиков и наш каталог, независимая лаборатория Artificial Analysis (одна методика на все модели) и наши собственные измерения по реальным запросам за 30 дней.

Одиннадцать раундов

В каждом раунде обеим моделям начисляется до 10 очков: лучший получает 10, второй — пропорционально отставанию (для метрик «ниже лучше» — по обратным величинам). Разница метрик до 5 % — ничья, обеим по 10. Если у одной из моделей нет данных, раунд не считается вовсе: строка помечается «не считается», а максимум счёта уменьшается. Страница индексируется поисковиками только при четырёх и более сыгранных раундах.

Предметные раунды — код, математика, инструменты, следование инструкциям, длинный контекст — считаются по нескольким замерам лаборатории сразу: у разных моделей измерены разные, и среднее по тем, что есть у обеих, честнее одной метрики с пропусками. Замер берётся с лучшего доступного варианта модели: сперва с рассуждениями, иначе без — то есть сравниваем, на что модель способна.

РаундКак считаемИсточник
1. Качество с рассуждениямииндекс интеллекта Artificial Analysis, режим с рассуждениямиЛаборатория
2. Качество без рассужденийтот же индекс, режим без рассуждений — как в чате и массовых задачахЛаборатория
3. Кодсреднее по доступным замерам: сводный индекс кодинга, LiveCodeBench, SciCodeЛаборатория
4. Математикасводный индекс математики и олимпиадные задачи AIMEЛаборатория
5. Инструменты и агентвызов инструментов (𝜏²-bench) и работа в терминале (Terminal-Bench)Лаборатория
6. Следование инструкциямIFBench: доля заданий, где соблюдены все требования к формату и содержаниюЛаборатория
7. Длинный контекстрассуждения на длинном контексте — не размер окна, а способность им пользоватьсяЛаборатория
8. Скоростьсреднее из очков за паузу до первого слова (ниже лучше) и токены в секунду (выше лучше)Hubris, 30 дней
9. Ценасреднее из очков за входные и выходные токены (ниже лучше)каталог Hubris
10. Кэшавтоматический — 9, явный (нужна пометка в запросе) — 7, нет — 3правила поставщика
11. Возможностиконтекст ≥ 900 тыс. — 3, ≥ 200 тыс. — 2, иначе 1; картинки — 2; файлы — 1; рассуждения — 2; не учится на данных — 2каталог Hubris

Переключатель «что важнее»

Сумма очков зависит от того, что вам важно, поэтому на каждой странице три расклада. «Всё поровну» — веса раундов равны. «Бюджет и скорость» удваивает раунды цены и скорости. «Качество любой ценой» удваивает оба раунда качества и не считает цену вовсе. Переключатель меняет и счёт по раундам, и сводную оценку; расклад можно передать ссылкой — #budget или #quality.

Сводная оценка

Одно число от 0 до 100 на модель — в отличие от счёта по раундам, оно не зависит от соперника: шесть составляющих (оба качества, скорость, цена, кэш, возможности) нормируются по всему каталогу, поэтому на одной шкале можно ставить засечки других моделей. Предметные раунды в сводную оценку не входят: они отвечают на вопрос «для какой задачи», а не «насколько модель хороша вообще». Цена берётся в логарифмической шкале — модель в десять раз дороже не получает ноль. Составляющие без данных исключаются из знаменателя.

Откуда наши цифры скорости

Пауза до первого слова — медиана времени до первого токена по успешным потоковым запросам через Hubris за последние 30 дней; скорость письма — медиана токенов в секунду от первого слова до конца ответа. В паузу входит и наш участок пути, поэтому цифры отражают то, что получает клиент, а не идеальные условия стенда. Модели с малой выборкой скорость не получают — раунд пропускается. Число запросов мы не публикуем.

Сторонние лидерборды

Рядом с раундами качества и кода мы показываем три открытых источника — справочно, очков они не приносят: методики у них разные, и складывать их в один счёт нечестно. SWE-bench Verified — доля настоящих багов, починенных в реальных репозиториях; результат там принадлежит связке «модель + агент», поэтому агента мы указываем рядом с цифрой и берём лучший известный прогон. LMArena — рейтинг Elo по слепым голосам людей, общая и кодовая доски. MERA — открытый бенчмарк на русском языке от Альянса в сфере ИИ, единственный из трёх, кто меряет именно русский.

Данные обновляются раз в сутки. Если источник временно недоступен, прошлые значения остаются на месте — страница не должна терять содержание из-за чужого простоя.

Что мы не сравниваем

Бенчмарки из карточек самих поставщиков: каждый вендор отчитывается своим набором тестов и своими версиями, и сопоставить их честно нельзя. Поэтому качество берётся только у лаборатории, где обе модели прошли одни и те же тесты. Доля попаданий в кэш тоже не показывается: она зависит от того, как именно клиент шлёт промпты, а не от модели.

← Ко всем сравнениям