Как мы сравниваем модели
Правила одни для всех пар и считаются кодом — руками очки не правятся. Три источника: карточки поставщиков и наш каталог, независимая лаборатория Artificial Analysis (одна методика на все модели) и наши собственные измерения по реальным запросам за 30 дней.
Шесть раундов
В каждом раунде обеим моделям начисляется до 10 очков: лучший получает 10, второй — пропорционально отставанию (для метрик «ниже лучше» — по обратным величинам). Разница метрик до 5 % — ничья, обеим по 10. Если у одной из моделей нет данных, раунд не считается вовсе: строка помечается «не считается», а максимум счёта уменьшается. Страница индексируется поисковиками только при четырёх и более сыгранных раундах.
| Раунд | Как считаем | Источник |
|---|---|---|
| 1. Качество с рассуждениями | индекс интеллекта Artificial Analysis, режим с рассуждениями | Лаборатория |
| 2. Качество без рассуждений | тот же индекс, режим без рассуждений — как в чате и массовых задачах | Лаборатория |
| 3. Скорость | среднее из очков за паузу до первого слова (ниже лучше) и токены в секунду (выше лучше) | Hubris, 30 дней |
| 4. Цена | среднее из очков за входные и выходные токены (ниже лучше) | каталог Hubris |
| 5. Кэш | автоматический — 9, явный (нужна пометка в запросе) — 7, нет — 3 | правила поставщика |
| 6. Возможности | контекст ≥ 900 тыс. — 3, ≥ 200 тыс. — 2, иначе 1; картинки — 2; файлы — 1; рассуждения — 2; не учится на данных — 2 | каталог Hubris |
Переключатель «что важнее»
Сумма очков зависит от того, что вам важно, поэтому на каждой странице три расклада. «Всё поровну» — веса раундов равны. «Бюджет и скорость» удваивает раунды цены и скорости. «Качество любой ценой» удваивает оба раунда качества и не считает цену вовсе. Переключатель меняет и счёт по раундам, и сводную оценку; расклад можно передать ссылкой — #budget или #quality.
Сводная оценка
Одно число от 0 до 100 на модель — в отличие от счёта по раундам, оно не зависит от соперника: те же шесть составляющих нормируются по всему каталогу, поэтому на одной шкале можно ставить засечки других моделей. Цена берётся в логарифмической шкале — модель в десять раз дороже не получает ноль. Составляющие без данных исключаются из знаменателя.
Откуда наши цифры скорости
Пауза до первого слова — медиана времени до первого токена по успешным потоковым запросам через Hubris за последние 30 дней; скорость письма — медиана токенов в секунду от первого слова до конца ответа. В паузу входит и наш участок пути, поэтому цифры отражают то, что получает клиент, а не идеальные условия стенда. Модели с малой выборкой скорость не получают — раунд пропускается. Число запросов мы не публикуем.
Что мы не сравниваем
Бенчмарки из карточек самих поставщиков: каждый вендор отчитывается своим набором тестов и своими версиями, и сопоставить их честно нельзя. Поэтому качество берётся только у лаборатории, где обе модели прошли одни и те же тесты. Доля попаданий в кэш тоже не показывается: она зависит от того, как именно клиент шлёт промпты, а не от модели.