LLM · замеры · июнь 2026

Какая нейросеть самая быстрая в 2026 году

Собрал сравнение ролевых LLM: кто быстрее отвечает в диалоге и кто раньше отдаёт первые слова. 17 моделей, один промпт, один прогон.

Ролевая модель в диалоге

Нужна была модель, которая нормально общается в роли — не сочиняет простыни, держит тон, отвечает по делу. Обычный чат без роли на это слабоват.

Плюс ролевой подход (особенно через агента в облаке): инструкцию и контекст загружаешь один раз, дальше по сети летит в основном вопрос пользователя — не таскаешь каждый раз огромный system-промпт. Меньше байт, меньше latency на входе.

Ниже — кто из популярных API тянет такую роль и как быстро отдаёт ответ. Прогон: 17 моделей параллельно, 5 повторов, один вопрос.

220 ms
лучший TTFT
17
моделей
5
повторов

Два способа задать роль

System в каждом запросе — промпт в теле chat/completion. Agent / Assistant — роль лежит у провайдера, в запросе только реплика собеседника.

Что замеряли

Инструкция оператора + вопрос «Здравствуйте, а что это за сервис и зачем вы звоните?». Yandex, OpenAI, DeepSeek, Grok — sync и stream где есть.

Термины простыми словами

Кликните на пункт — коротко, без занудства.

Ролевая модель
Та же нейросеть, но вы заранее говорите ей, кто она: «ты оператор, отвечай коротко». Без этого она болтает как обычный чат.

Можно писать роль в каждом запросе. А можно один раз настроить агента в облаке — тогда инструкция лежит у Yandex или OpenAI, а вы шлёте только вопрос собеседника.

В чём плюс: длинный промпт не таскается по сети на каждую реплику — меньше данных, быстрее отклик. Особенно заметно в диалоге, где вопросов много подряд.
Стриминг
Ответ приходит не целиком, а по частям — как когда собеседник печатает в мессенджере. Сначала пара слов, потом остальное.

Для голоса это удобно: озвучку можно запускать сразу, не дожидаясь полного текста.
Миллисекунды (ms)
Единица для замеров скорости. 1000 ms = 1 секунда.

220 ms — меньше четверти секунды, почти мгновенно. 1700 ms — уже заметная пауза. В таблице все задержки в ms.
TTFT
Time to first token — сколько ждать до первого слова ответа.

Отправили вопрос → засекли время → пришёл первый кусочек текста. Чем меньше TTFT, тем быстрее в трубке перестаёт быть тишина.
Sync (без стрима)
Обычный режим: отправили запрос, ждёте, приходит весь ответ сразу. Никаких кусочков по пути.

В таблице колонка Sync avg — сколько ms прошло до полного текста.

Почему «медленная» может звучать быстрее

Ловушка: смотреть только на полное время ответа. Модель может отдать весь текст за 600 ms в sync — звучит неплохо. Но абонент всё это время молчит в трубке, пока TTS не получит полный текст.

Другая модель в стриме отдаёт первый чанк за 220 ms — голос уже пошёл, хотя весь ответ догоняется ещё ~400 ms.

Sync

1704 ms

OpenAI mini — тишина до полного текста. Потом разом озвучка.

Stream · TTFT

220 ms

Yandex lite Chat — первые слова раньше. Хвост догоняет в фоне.

Кто быстрее отдал первый чанк (TTFT, среднее по 5 прогонам):

Yandex lite · chat
220
Yandex lite · completion
300
OpenAI mini · stream
1192
DeepSeek · stream
1514
Grok · stream
2053
Коротко: для живого диалога смотрите на TTFT и стриминг. Sync-цифра — «сколько ждать в тишине до всего ответа целиком». Параллельный прогон чуть завышает ms, но порядок мест тот же.

Почему разброс

География API, длина промпта, размер модели, нагрузка на сервер. Yandex шлёт ~2 крупных чанка, OpenAI — десятки мелких. В burst все 17 стартовали одновременно — сеть делилась.

Один прокси для всех

Все запросы шли через один и тот же прокси — и Yandex, и OpenAI, и остальные. Задержка на прокси была для каждой модели одинаковая: в цифрах сравниваем скорость API, а не «кому повезло с маршрутом».

Все результаты

Burst 28.06.2026 · Mac · один промпт · avg по 5 прогонам. Для stream в TTFT — время до первого чанка, Total — до конца генерации. Стоимость — прогноз за 1000 символов типового хода.

Результаты бенчмарка LLM: sync avg, TTFT, total stream и стоимость за 1000 символов
# Провайдер Модель Режим Sync avg TTFT avg Total stream ₽ / 1000 симв
1 Yandex yandexgpt-lite Completion sync · заказ 429 ms ~0.067 ₽
2 Yandex yandexgpt-lite Completion stream 300 ms 659 ms ~0.067 ₽
3 Yandex yandexgpt-lite Chat stream 220 ms 595 ms ~0.067 ₽
4 Yandex yandexgpt Pro Completion sync 838 ms ~0.40 ₽
5 Yandex yandexgpt-lite Agent (Responses) 652 ms ~0.067 ₽
6 OpenAI gpt-4o-mini Chat sync 1704 ms ~0.007 ₽
7 OpenAI gpt-4o-mini Chat stream 1192 ms 1661 ms ~0.007 ₽
8 OpenAI gpt-4o Chat sync 2104 ms ~0.12 ₽
9 OpenAI gpt-4o-mini Assistant v2 4330 ms ~0.007 ₽
12 DeepSeek deepseek-chat Chat sync 2094 ms ~0.005 ₽
13 DeepSeek deepseek-chat Chat stream 1514 ms 2267 ms ~0.005 ₽
15 Yandex yandexgpt-5-lite Completion sync · заказ 628 ms ~0.067 ₽
16 Yandex yandexgpt-5-lite Completion stream 569 ms 986 ms ~0.067 ₽
17 Yandex yandexgpt-5-lite Chat stream 550 ms 968 ms ~0.067 ₽
18 xAI grok-4.3 Chat sync 2376 ms
19 xAI grok-4.3 Chat stream 2053 ms 2252 ms
20 Yandex yandexgpt-lite Completion sync · оператор 676 ms ~0.067 ₽

Стоимость: прогноз за 1000 символов (75% промпт, 25% ответ). Тарифы провайдеров — июнь 2026, зарубежные API пересчитаны по 78.91 ₽/$. У Grok в прогоне не было публичного тарифа.

Другие статьи