Наглядная страница по batch-бенчам: сколько одновременных запросов держит каждая модель, где ломается TTFT, что происходит со скоростью на один запрос, и какие серверные метрики это объясняют.
Не максимальная красивая цифра, а полезная сводка: SLA capacity, speed avg/max, total output speed avg/max и главная проблема.
Максимальная пачка, которая проходит выбранный SLA. Это ближе к “сколько можно продавать”, чем просто raw throughput.
Полосы показывают диапазон speed avg от легкой точки к максимальной протестированной пачке: скорость падает, TTFT растет.
Выбери профиль и смотри четыре ключевых графика без лишнего шума.
Эта часть отвечает “почему”: очередь, running requests, prefix cache, GPU/KV.
Только самые нужные колонки, чтобы быстро сверить конкретную точку.
Это старый подробный CSV: screening, thoughtful runs, chat, long-context, mixed, noisy-neighbor и agentic. Он не заменяет batch capacity, а показывает историю нагрузочных точек и стабильность по RPS.
speed avg / max = скорость одного запроса;
total output speed avg / max = суммарная output-скорость всей нагрузки.
Графики агрегируют повторные historical runs в одну точку на модель и нагрузку, чтобы не перегружать chat_short; все сырые строки остаются в таблице ниже.
На графиках линия показывает avg, а max видно в tooltip и таблицах.
Сводка по выбранному профилю: максимум total output speed, лучшая speed avg и максимальный стабильный RPS.
Нормализованные поля из results/all_benchmarks_full.csv.
Свежий перенос от 2026-07-07: сверху показаны два common-step rerun на 2xPRO6000, включая отдельный ctx262 ряд, и точный B200-style overlap на одинаковых ext1400 datasets и concurrency steps. Старые июльские PRO6000 fullrebench/fixed-seq точки здесь больше не смешиваются.
Это главный честный участок отчета: для B200 reference и свежего PRO6000 совпадают ext1400 datasets и concurrency steps. H200 здесь не показан, потому что такого же B200-style reference в bundle нет.
Этот блок показывается только если в свежем переносе есть fixed-seq overlap. В bundle от 2026-07-07 таких строк нет, поэтому stale July 2 данные скрываются.
A100/H200/B200 reference из сохраненного pack плюс свежие 2xPRO6000 common reruns: основной timeout1200 и отдельный ctx262 timeout1800 на той же short/medium/complex матрице.
Short/medium/complex теперь включает два 2xPRO6000 row рядом с A100/H200/B200 reference, чтобы было видно влияние ctx262.
Сводка по тем же common-step task classes, оформленная как быстрый overlay для чтения рядом с таблицей.
Точки из `common_timeout1200_20260707_124713`, ctx262 `common_timeout1800/20260707_163428` и `b200style_timeout600_20260707_132134`; это свежие переносимые runs, а не старый локальный rebench.
Числа из сохраненных CSV/JSON. Ссылки на исходные файлы лежат рядом в snapshot-папке.