hubris

Как мы сравниваем модели

Правила одни для всех пар и считаются кодом — руками очки не правятся. Три источника: карточки поставщиков и наш каталог, независимая лаборатория Artificial Analysis (одна методика на все модели) и наши собственные измерения по реальным запросам за 30 дней.

Шесть раундов

В каждом раунде обеим моделям начисляется до 10 очков: лучший получает 10, второй — пропорционально отставанию (для метрик «ниже лучше» — по обратным величинам). Разница метрик до 5 % — ничья, обеим по 10. Если у одной из моделей нет данных, раунд не считается вовсе: строка помечается «не считается», а максимум счёта уменьшается. Страница индексируется поисковиками только при четырёх и более сыгранных раундах.

РаундКак считаемИсточник
1. Качество с рассуждениямииндекс интеллекта Artificial Analysis, режим с рассуждениямиЛаборатория
2. Качество без рассужденийтот же индекс, режим без рассуждений — как в чате и массовых задачахЛаборатория
3. Скоростьсреднее из очков за паузу до первого слова (ниже лучше) и токены в секунду (выше лучше)Hubris, 30 дней
4. Ценасреднее из очков за входные и выходные токены (ниже лучше)каталог Hubris
5. Кэшавтоматический — 9, явный (нужна пометка в запросе) — 7, нет — 3правила поставщика
6. Возможностиконтекст ≥ 900 тыс. — 3, ≥ 200 тыс. — 2, иначе 1; картинки — 2; файлы — 1; рассуждения — 2; не учится на данных — 2каталог Hubris

Переключатель «что важнее»

Сумма очков зависит от того, что вам важно, поэтому на каждой странице три расклада. «Всё поровну» — веса раундов равны. «Бюджет и скорость» удваивает раунды цены и скорости. «Качество любой ценой» удваивает оба раунда качества и не считает цену вовсе. Переключатель меняет и счёт по раундам, и сводную оценку; расклад можно передать ссылкой — #budget или #quality.

Сводная оценка

Одно число от 0 до 100 на модель — в отличие от счёта по раундам, оно не зависит от соперника: те же шесть составляющих нормируются по всему каталогу, поэтому на одной шкале можно ставить засечки других моделей. Цена берётся в логарифмической шкале — модель в десять раз дороже не получает ноль. Составляющие без данных исключаются из знаменателя.

Откуда наши цифры скорости

Пауза до первого слова — медиана времени до первого токена по успешным потоковым запросам через Hubris за последние 30 дней; скорость письма — медиана токенов в секунду от первого слова до конца ответа. В паузу входит и наш участок пути, поэтому цифры отражают то, что получает клиент, а не идеальные условия стенда. Модели с малой выборкой скорость не получают — раунд пропускается. Число запросов мы не публикуем.

Что мы не сравниваем

Бенчмарки из карточек самих поставщиков: каждый вендор отчитывается своим набором тестов и своими версиями, и сопоставить их честно нельзя. Поэтому качество берётся только у лаборатории, где обе модели прошли одни и те же тесты. Доля попаданий в кэш тоже не показывается: она зависит от того, как именно клиент шлёт промпты, а не от модели.

← Ко всем сравнениям