Что нового

Сравнение нейросетей в 2026: GPT-5.6, Claude Opus 5, Gemini, Grok 4.6 и DeepSeek V4 — какую выбрать

  • Автор Автор Guru
  • Дата публикации Дата публикации
  • Посл. обновление Обновлено
  • Время чтения статьи Время чтения статьи 14 мин чтения
  • Теги Теги
    claude opus deepseek gemini gpt grok
Рынок выкатывает новую «самую умную модель в истории» каждые полтора месяца — и с прошлой редакции этого разбора успел выкатить их штук восемь. GPT-5.6 (Sol / Terra / Luna), Claude Opus 5, Gemini 3.7 Flash, Grok 4.6, DeepSeek V4-Pro GA — весь список из заголовка июньской версии сменился целиком, а DeepSeek, тот самый «дешёвый рабочий конь», с 16 августа поднимает прайс местами в двенадцать раз. Соблазн понятен: оплатить весь зоопарк по двадцатке за штуку и не думать. Я думаю иначе: под рукой держу один-два платных, остальное гоняю на бесплатных тарифах или через API¹ под конкретную автоматизацию.
1786787074965.png

Ниже — трезвый разбор без рекламы: что каждая реально умеет, где сыпется, и сколько стоит на 15 августа 2026.

Сразу про бенчмарки²: это болото. Цифры пляшут от харнесса³ и варианта теста, вендоры публикуют свои таблицы, где сами же и выигрывают, а независимой перепроверки на момент релиза не бывает вообще. Показательно: Grok 4.6, GPT-5.6 Sol и Claude Opus 5 сейчас сидят в пределах пары пунктов друг от друга по сводным индексам — то есть «кто умнее» перестало быть вопросом, на который есть осмысленный ответ. Вопрос теперь только один: сколько стоит доведённая до конца задача. Поэтому красивой таблицы «кто на сколько процентов умнее» тут не будет — будут возможности, грабли и деньги.

Что поменялось с июня​

  • OpenAI переименовала линейку: вместо «одной модели с ручкой» — три тира, GPT-5.6 Sol / Terra / Luna. 30 июля Terra подешевела на 20%, Luna — на 80%. Sol не тронули.
  • Anthropic за два месяца выкатила четыре модели: Mythos 5 (закрытый доступ), Fable 5, Opus 5 (24 июля, по цене старого Opus 4.8) и Sonnet 5. Opus 4.8 больше не актуален.
  • Google так и не выпустила Gemini 3.5 Pro — флагман с февраля не обновлялся. Зато Flash-линейка выходит раз в три недели: 3.6 (21 июля), 3.7 (13 августа, вдвое дешевле).
  • xAI переименовалась в SpaceXAI после поглощения SpaceX. Grok 4.5 (8 июля), Grok 4.6 (12 августа) — цена не двигалась, контекст⁴ 500K.
  • DeepSeek вывела V4-Pro из превью (12–13 августа) и выложила веса⁵ под MIT⁶ — и тут же объявила рост цен с 16 августа, от +50% до +1100%.
  • Sora умерла: приложение закрыли 26 апреля, API отключают 24 сентября. Преемника OpenAI не анонсировала.
  • Появился полноценный слой открытых весов помимо DeepSeek: Kimi K3, GLM-5.2, Qwen. Раньше это была одна строчка, теперь — отдельный раздел.

Кратко — кому что и для чего​

  • Кодинг и рефакторинг, где важно качество, а не скорость → Claude Opus 5 / Claude Code. Дёшево при достойном качестве — Claude Sonnet 5 или Gemini 3.7 Flash.
  • Многошаговый агент⁷, офисная рутина, ресёрч в одном окне → GPT-5.6 Sol.
  • Дешёвый прод под агентские циклы → Gemini 3.7 Flash или GPT-5.6 Luna.
  • Реалтайм-новости, X, менее зафильтрованные ответы → Grok 4.6.
  • Self-host⁸ и экономия на масштабе → DeepSeek V4, GLM-5.2, Kimi K3 — веса открыты.
  • Поиск с пруфами на источники → Perplexity.
Теперь по каждому, с ценами и граблями.

GPT-5.6 Sol / Terra / Luna — OpenAI​

Что это. Новое поколение OpenAI: превью 26 июня, общий доступ 9 июля 2026. Схема именования сменилась — цифра означает поколение, а Sol / Terra / Luna — постоянные тиры, которые дальше живут своим темпом. Sol — флагман под сложный ресёрч, длинные агентские прогоны и кодинг; Terra — рабочая лошадь под ежедневный прод; Luna — быстрая и дешёвая под высоконагруженное. Контекст у всех трёх 1.05M. Кодинг-агент Codex и ChatGPT Work (агентский воркспейс с коннекторами к Slack, Gmail, Drive и ещё шестидесяти сервисам) — в комплекте.

Силён. Универсал, как и раньше. Если задача в формате «дай сделать всё в одном окне» — это сюда: agentic coding, computer use⁹, ресёрч, офисная рутина. Плюс к тому Sol пока держит первое место по терминальным задачам — на Terminal-Bench обходит и Grok 4.6, и Claude.

Слаб. Sol кусается: $5/$30, и это единственный тир, который за лето не подешевел ни на цент. На длинном контексте (свыше 272K токенов¹⁰) счётчик переключается на $10/$45 — причём на весь запрос целиком, а не на хвост. Тарифов по-прежнему семь, и два разных «Pro» по $100 и $200 никуда не делись. Реклама в бесплатном ChatGPT из американского пилота разъехалась на семь стран и, по независимым замерам, висит примерно под половиной ответов у free-пользователей. И да: Sora больше нет — видео из экосистемы выпало.

Цена. Подписки: Free $0 / Go $8 / Plus $20 / Pro $100 (5× лимиты) / Pro $200 (20×). Business $20–25 за место. С 6 августа во Free и Go по умолчанию крутится Luna с безлимитным текстовым чатом; Sol доступен с Plus и выше. API за 1M токенов (вход/выход): Sol $5 / $30, Terra $2 / $12, Luna $0.20 / $1.20. Чтение из кэша¹¹ — минус 90%, запись в кэш — 1.25× от цены входа. Старый GPT-5.5 всё ещё в прайсе по $5/$30, GPT-5.5 Pro — $30/$180.

Claude Opus 5 — Anthropic​

Что это. Вышел 24 июля 2026 и занял место Opus 4.8 по той же цене — $5/$25. Контекст 1M, выход до 128K, ручка effort (low / high / xhigh / max) для торга глубины рассуждения¹² против цены прямо в вызове. Порог знаний — май 2026, самый свежий среди Claude. По умолчанию идёт на тарифе Max и является старшей моделью на Pro. Под кодинг — Claude Code, под остальную работу — Cowork (агент с сессиями в облачных песочницах, расписанием и синком между десктопом, вебом и мобилой).

Силён. Кодинг и аккуратность — та же ниша, что и у 4.8, только выше. Anthropic позиционирует его как «почти Fable 5 за половину денег», и по ощущениям это близко к правде: за ним меньше приходится переделывать, а на длинных автономных прогонах он реже уходит в сторону. Отдельно приятное для тех, кто носит данные через API: у Opus 5 нет требования по хранению запросов, тогда как у Fable 5 — 30 дней. Плюс защитные классификаторы срабатывают заметно реже, чем на Fable, — меньше ложных отказов на нормальных задачах.

Слаб. Премиальная цена выхода ($25 за 1M) никуда не делась. Бесплатного API нет. И структура тиров теперь трёхэтажная: над Opus сидит Fable 5 ($10/$50), над ним — Mythos 5 с закрытым доступом для проверенных организаций. То есть за самый-самый топ Anthropic хочет отдельных денег, а за самый-самый-самый — ещё и отдельного разрешения. По собственным графикам Anthropic, Opus 5 отстаёт от Fable 5 на юридических и медицинских тестах и уступает GPT-5.6 Sol на одном из кодинг-бенчмарков. Ну и лето вышло нервным: Fable 5 и Mythos 5 вышли 9 июня, 12 июня их отключили под экспорт-контроль Минторга США, вернули только 1 июля.

Цена. Подписки: Free $0 / Pro $20 ($17/мес при годовой оплате) / Max 5× $100 / Max 20× $200. Team — $20–25 за место, Premium-место под Claude Code — $100–125. API: Opus 5 — $5 / $25 (Fast-режим, ×2.5 по скорости — $10/$50), Fable 5 — $10 / $50, Sonnet 5 — $2 / $10 до 31 августа, дальше $3 / $15, Haiku 4.5 — $1 / $5. Кэш режет вход до 90%, batch¹³ — вдвое. Реклама в продуктах Claude отсутствует и не планируется — Anthropic это отдельно проговаривала публично.

Gemini 3.1 Pro и 3.7 Flash — Google​

Что это. И вот тут главная новость сезона — точнее, её отсутствие. Флагман Google не обновлялся с 19 февраля: Gemini 3.1 Pro как был, так и остался. Обещанный на июнь 3.5 Pro не вышел, по Reuters — не добрал внутренних целевых показателей, на вопрос о сроках Пичаи на квартальном звонке отвечать не стал. Зато Flash-линейка шпарит: 3.6 Flash 21 июля, 3.7 Flash 13 августа — через три недели после предыдущей. Плюс 3.5 Flash-Lite под высоконагруженное и 3.5 Flash Cyber (поиск и починка уязвимостей) — этот только для государств и доверенных партнёров.

Силён. Мультимодал¹⁴ и цена внизу линейки. Текст, код, аудио, видео, картинки, PDF — всё нативно, одним промптом, и с Workspace сросся намертво. А 3.7 Flash по деньгам сейчас лучшее предложение на рынке: $0.75/$3.75 — вдвое дешевле 3.6 Flash при заметно лучшем кодинге (FrontierCode 1.1: 43.6% против 34.4%, DeepSWE: 65.3% против 49.0%). Если у вас агентский цикл, который жуёт токены вёдрами, — считайте сюда.

Слаб. Контекст перестал быть козырем: у 3.1 Pro это 1M, ровно как у всех, а обещанные 2M ушли вместе с невышедшим 3.5 Pro. Retrieval¹⁵ по-прежнему деградирует за 128K — рабочую нагрузку выгоднее держать в этих рамках. Цена $0.75/$3.75 у 3.7 Flash — вводная, до 31 декабря 2026, с 1 января ровно вдвое дороже. Из API выпилили параметры сэмплирования temperature, top_p и top_k — миграция с 3.x на 3.7 это не «поменять строку модели», а поправить контракт. И общее ощущение, что Google в 2026-м воюет за нижний ценовой сегмент, потому что на верхнем ей пока предъявить нечего.

Цена. Подписки: Free $0 (Flash-модели) / AI Plus $4.99 (срезали с $7.99 8 июня) / AI Pro $19.99 / AI Ultra $99.99–$199.99. API: 3.1 Pro — $2 / $12 (≤200K), $4 / $18 (>200K), кэш $0.20; 3.7 Flash — $0.75 / $3.75 до конца года, потом $1.50 / $7.50; 3.5 Flash-Lite — $0.30 / $2.50.

Grok 4.6 — SpaceXAI​

Что это. Сначала об организационном: xAI влилась в SpaceX в феврале, а в июле контора официально переименовалась в SpaceXAI. Grok 4.5 вышел 8 июля (модель V9-Medium, 1.5 трлн параметров, тренированная в том числе на данных Cursor), Grok 4.6 — 12 августа. Это не новая база, а дообучение поверх той же V9: длиннее supplemental-прогон, перегенерированные SFT-траектории, RL в агентских средах. Контекст 500K, вход текст+картинки, добавился уровень усилия xhigh.

Силён. Соотношение «интеллект за деньги» — сейчас лучшее среди закрытых флагманов. По сводному индексу Artificial Analysis Grok 4.6 идёт вровень с GPT-5.6 Sol и в шаге позади Opus 5, при цене $2/$6 против $5/$30 у Sol. Плюс реалтайм: что происходит прямо сейчас, тренды, свежие события — Grok видит через X, остальные узнают с лагом. По собственной таблице SpaceXAI выигрывает строки «knowledge work» и «legal». Ну и личность, если она вам зачем-то в работе нужна.

Слаб. Терминальные задачи — Terminal-Bench v3.0 он проигрывает GPT-5.6 Sol примерно на 8.6 пункта, и в тексте анонса эту строчку аккуратно обошли. Заголовочные $2/$6 — только до 200K токенов входа; выше порога тариф становится $4/$12, и применяется ко всему запросу целиком, а не к превышению. Независимой перепроверки заявленных цифр на момент выхода нет вообще. Модерация хромает исторически. Плюс staged rollout¹⁶: на дешёвых тарифах твой запрос может уехать на старую версию модели, и ты этого не заметишь. Порог знаний — 1 февраля 2026, самый старый в пятёрке. Grok 5 обещают до конца года, но его обещали уже дважды.

Цена. Подписки: Free $0 / SuperGrok Lite $10 / SuperGrok $30 / SuperGrok Plus $100 / SuperGrok Heavy $300; через X — Premium $8, Premium+ $40; Business — $30 за место. С июня платные тарифы работают на одном общем недельном пуле, расходуемом на Chat, Imagine, Voice и Build; старые лимиты «N промптов за 2 часа» отменены. API: Grok 4.6 — $2 / $6 (кэш $0.50) до 200K, дальше $4 / $12 (кэш $1); Fast-вариант — вдвое дороже. Голос: Grok Voice Think Fast 2.0 — $0.08 за минуту аудио.

DeepSeek V4 — и конец халявы​

Что это. V4-Pro (1.6 трлн параметров, 49 млрд активных) и V4-Flash (284 млрд / 13 млрд) — две MoE¹⁷-модели с контекстом 1M и выходом до 384K. Flash вышла из превью 31 июля, Pro — 12–13 августа, веса обеих лежат на Hugging Face под MIT. API говорит и форматом OpenAI, и форматом Anthropic, так что цепляется к Claude Code / OpenCode без прокладок. Инженерно там сделано главное: гибридное внимание срезало вычисления на длинном контексте примерно вчетверо, а память KV-кэша — вдесятеро против V3.2.

Силён. Открытость. Это по-прежнему модель, которую можно поднять у себя, без оглядки на чужое облако, — если, конечно, потянете 1.6 трлн весов. По SWE-bench Verified V4-Pro даёт 80.6% (по данным вендора) — лучший результат среди скачиваемых весов.

Слаб. Цена, и это теперь главное. С 16:00 UTC 16 августа DeepSeek уходит с плоского тарифа на peak/off-peak¹⁸, и «off-peak» — это не скидка, а просто половина от нового пика, всё равно выше старой цены:
  • V4-Pro: выход $0.87 → $1.98 (off-peak) / $3.96 (peak). Вход (промах кэша) $0.435 → $0.66 / $1.32.
  • V4-Flash: выход $0.28 → $0.66 / $1.32. Вход $0.14 → $0.22 / $0.44. Попадание в кэш $0.0028 → $0.007 / $0.014, то есть впятеро.
Пик — 01:00–04:00 и 06:00–10:00 UTC, то есть 04:00–07:00 и 09:00–13:00 по Москве. Семь часов пиковых, семнадцать дешёвых. Формулировка вендора — «более рационально распределить ресурсы», перевод — «мы упёрлись в мощности и готовимся к IPO». Плюс китайская юрисдикция никуда не делась, зрелость API ниже, чем у Tier-1¹⁹, а старые алиасы deepseek-chat и deepseek-reasoner отключили 24 июля — если у вас в скриптах они, всё уже сломалось.

Цена. Приложение и веб — бесплатно. API с 16 августа (off-peak / peak за 1M): V4-Pro — $0.66/$1.32 вход, $1.98/$3.96 выход; V4-Flash — $0.22/$0.44 вход, $0.66/$1.32 выход. Batch-тарифа нет. Всё ещё дешевле западных флагманов, но «на порядок дешевле» больше не работает: GPT-5.6 Luna в пике оказывается дешевле V4-Flash по входу.

Открытые веса — уже не только DeepSeek​

За лето скачиваемых моделей фронтирного класса стало три с половиной, и это, пожалуй, главное структурное изменение рынка.
  • Kimi K3 (Moonshot, июль) — 2.8 трлн параметров, крупнейшая открытая модель на сегодня, контекст 1M, лицензия Modified MIT (пункт об атрибуции включается только выше 100 млн MAU — вам не грозит). Держит первое место на открытых лидербордах и обходит Claude Fable 5 на Frontend Code Arena. API дорогой: $3 / $15, попадание в кэш $0.30.
  • GLM-5.2 (Z.ai) — 744 млрд / 40 млрд активных, MIT, контекст 1M. Прайс вендора $1.40 / $4.40, но веса открыты и сторонние хостеры отдают медиану ближе к $0.55 / $1.85. Лучший баланс, если считать за цену.
  • Qwen (Alibaba) — старшие Max-модели только по API, без весов. Реально скачиваемое и запускаемое дома — Qwen3.6-35B-A3B под Apache 2.0, единственное из перечисленного, что влезает в разумное железо.
Общий вывод простой: разрыв между закрытым фронтиром и открытыми весами по кодингу сжался до нескольких пунктов, а по фронтенду местами уже перевернулся. Но «открытые веса» ≠ «дёшево в self-host»: 1.6–2.8 трлн параметров — это многонодовый GPU-кластер, а не одна коробка под столом. Реалистичная схема на сегодня — API для старших, self-host для GLM-5.2 или Qwen, шлюз перед всем этим.

Картинки, видео, музыка — коротко​

Главное событие: Sora закрыта. Приложение отключили 26 апреля 2026, API доживает до 24 сентября, преемника нет. Официальной причины не назвали, неофициальные — экономика: инференс видео на порядки дороже текста, а аудитория после стадии новизны просела вдвое. Верх лидербордов теперь занимают китайские модели: Seedance 2.0 (ByteDance), HappyHorse-1.0 (Alibaba), Kling 3.0 с четырьмя позициями в топ-10. Из западного в строю Veo 3.1 (Google, с обязательным вотермарком SynthID) и Grok Imagine Video 1.5, который держит первое место по image-to-video. Google отдельно выкатила Gemini Omni Flash — видеомодель с редактированием в диалоге. Из открытого чисто по лицензиям: LTX-2.3, Wan 2.7, HunyuanVideo 1.5 — все Apache 2.0. Голос и озвучка — ElevenLabs. Если видео нужно изредка, держать ради него топ-тариф глупо — выгоднее поштучные кредиты или агрегатор.

Сводные цены​

15 августа 2026, в USD. Цены протухают быстро — с прошлой редакции этой статьи их переписали у всех пятерых. Перед оплатой открой прайс вендора и проверь сам.

Подписки (потребительские, $/мес)​

СервисFreeНачальный платныйСреднийТоп
ChatGPT$0 (с рекламой)Go $8 / Plus $20Pro $100Pro $200
Claude$0Pro $20 ($17 годовой)Max 5× $100Max 20× $200
Gemini$0AI Plus $4.99 / AI Pro $19.99AI Ultra $99.99Ultra $199.99
Grok$0Lite $10 / SuperGrok $30Plus $100Heavy $300
DeepSeek$0
Perplexity$0Pro $20Max $200

API ($/1M токенов, вход / выход, стандартный тариф)​

МодельВходВыходКонтекстВеса
GPT-5.6 Sol$5 (>272K: $10)$30 (>272K: $45)1.05Mзакр.
GPT-5.6 Terra$2$121.05Mзакр.
GPT-5.6 Luna$0.20$1.201.05Mзакр.
Claude Fable 5$10$501Mзакр.
Claude Opus 5$5$251Mзакр.
Claude Sonnet 5$2 (с 01.09: $3)$10 (с 01.09: $15)1Mзакр.
Claude Haiku 4.5$1$5закр.
Gemini 3.1 Pro$2 (>200K: $4)$12 (>200K: $18)1Mзакр.
Gemini 3.7 Flash$0.75 (с 2027: $1.50)$3.75 (с 2027: $7.50)1Mзакр.
Gemini 3.5 Flash-Lite$0.30$2.501Mзакр.
Grok 4.6$2 (>200K: $4)$6 (>200K: $12)500Kзакр.
DeepSeek V4-Pro (с 16.08)$0.66 / $1.32$1.98 / $3.961MMIT
DeepSeek V4-Flash (с 16.08)$0.22 / $0.44$0.66 / $1.321MMIT
Kimi K3$3$151MMod. MIT
GLM-5.2$1.40$4.401MMIT
У DeepSeek указано off-peak / peak. Пик — 01:00–04:00 и 06:00–10:00 UTC.

Что со всем этим делать​

Не стакай подписки. Стопка из пяти «двадцаток» — это $110+ в месяц непонятно за что; реально ты жуёшь две, остальные открываешь раз в неделю.

Рабочая стратегия не изменилась: один платный под основную задачу плюс остальные на бесплатных тарифах — для второго мнения и перепроверки. Под автоматизацию и скрипты — API, а не подписка: там платишь за факт, а кэш и batch режут счёт на порядок.

Что изменилось в раскладе с июня:
  • DeepSeek перестал быть безусловным дешёвым конём. С 16 августа считайте заново, особенно если нагрузка приходится на утро по Москве. Батчить некритичное в off-peak и держать стабильный префикс промпта под кэш — теперь не микрооптимизация, а разница в разы.
  • Gemini 3.7 Flash — новый ценовой ориентир под агентские циклы, но вводная цена держится только до конца года. Закладывайтесь на удвоение с 1 января.
  • Grok 4.6 — лучший интеллект на доллар среди закрытых. Если не упираетесь в терминальные задачи и не боитесь SpaceXAI как вендора, это разумный дефолт под чат и код.
  • GPT-5.6 — универсальный агент под «сделай всё сам в одном окне». Терра и Луна дёшевы, Sol — нет.
  • Claude (Opus 5) — когда код должен быть правильным с первого раза, а не после пятой итерации. И единственный из пятёрки, где над флагманом стоит ещё два закрытых этажа.
  • Открытые веса — уже не «DeepSeek или ничего». GLM-5.2 и Qwen дают реальный self-host, K3 — фронтир по API.
И ещё раз про деньги: тарифы переписывают постоянно, и в этот раз — в обе стороны. OpenAI за месяц срезала Luna на 80%, Google выкатила Flash вдвое дешевле предыдущего, а DeepSeek поднял выход в четыре раза. Любую цифру отсюда перед оплатой проверяй на сайте вендора — к моменту, когда ты это читаешь, половина уже могла сдвинуться.

Словарик​

¹ API — способ обращаться к модели не через сайт или приложение, а напрямую из своего кода или скрипта. Платишь по факту, за объём обработанного текста, а не фиксированную подписку.

² Бенчмарк — стандартный набор задач, на котором гоняют модели, чтобы сравнить их «в попугаях». Беда в том, что результат сильно зависит от того, как именно поставлен тест, и что почти все громкие цифры публикует сам вендор.

³ Харнесс (test harness) — обвязка вокруг теста: код и окружение, которые подсовывают модели задачу, дают ей инструменты, ловят ответ и проверяют его. Один и тот же вопрос в разном харнессе даёт разные цифры — поэтому проценты от разных команд впрямую несравнимы.

Контекстное окно — сколько текста модель удерживает «в голове» за один разговор: твой промпт плюс её ответы. Меряется в токенах. Всё, что вылезло за окно, модель просто забывает.

Веса (открытые) — веса это, грубо, сами «мозги» обученной модели: файл с её параметрами. Открытые веса (open weights) можно скачать и запускать у себя; у закрытых моделей доступ только через чужой сервис.

MIT — максимально либеральная открытая лицензия: бери, меняй, используй хоть в коммерции, почти без условий.

Агент / агентность — режим, в котором модель не просто отвечает текстом, а действует по шагам: вызывает инструменты, лезет в веб, запускает код, проверяет результат и идёт дальше, пока не доведёт задачу до конца.

Self-host — запуск модели на своём железе вместо чужого облака. Возможен, только если выложены веса. Плюс — полный контроль и приватность, минус — нужен мощный сервер, а для триллионных моделей — кластер.

Computer use — способность модели управлять компьютером как человек: видеть экран, кликать, печатать, ходить по интерфейсу программ.

¹⁰ Токен — кусочек текста, которым оперирует модель: примерно 3–4 символа или часть слова. Тарифы API считают за миллион токенов, отдельно за вход (что подаёшь) и отдельно за выход (что модель генерит).

¹¹ Кэш (кэширование промпта) — если большой кусок промпта (кодовая база, системная инструкция) повторяется из запроса в запрос, его кэшируют, и за повторное чтение платишь копейки вместо полной цены входа. Важно: запись в кэш обычно дороже обычного входа, так что выигрыш появляется только при стабильном префиксе.

¹² Thinking / reasoning effort — режим, когда модель перед ответом «думает» про себя, раскладывая задачу на шаги, и ручка, которой глубину этих размышлений можно крутить. Точнее на сложном, но дороже и медленнее: размышления тоже считаются как выходные токены.

¹³ Batch (пакетный режим) — складываешь кучу запросов в один пакет и получаешь ответы не мгновенно, а в течение нескольких часов, зато примерно вдвое дешевле.

¹⁴ Мультимодал — модель понимает не только текст, но и картинки, аудио, видео на входе (а иногда и на выходе).

¹⁵ Retrieval — способность реально достать нужный факт из длинного контекста, а не формально его «видеть». На очень длинном окне точность проседает: модель теряет детали из середины.

¹⁶ Staged rollout — раскатка новой версии не всем сразу, а волнами. Поэтому на дешёвом тарифе тот же запрос может временно обслужить ещё старая модель.

¹⁷ MoE (Mixture-of-Experts) — архитектура, где модель разбита на много «экспертов», но на каждый запрос включается лишь часть из них. Поэтому у V4-Pro 1.6 трлн параметров всего, а «активных» на один токен — только 49 млрд: ёмкость большая, а считать дешевле.

¹⁸ Peak / off-peak — тариф, зависящий от времени суток: в часы пиковой нагрузки дороже, в остальные дешевле. Вендору позволяет размазать нагрузку по суткам, тебе — сэкономить, если задача терпит и её можно сдвинуть в ночь.

¹⁹ Tier-1 — первый эшелон: крупнейшие и самые отлаженные поставщики (OpenAI, Google, Anthropic). «Зрелость ниже, чем у Tier-1» значит, что инфраструктура и стабильность пока не дотягивают до них.

Данные актуальны на 15 августа 2026. Цены — в долларах, по прайсам вендоров; бенчмарки сознательно опущены как недостоверные на текущем рынке.
Об авторе
Guru
Василий, cистемный админ /gnu/linux/windows/macos/mikrotik/troubleshooter, создатель сайта
Интересуюсь всем что делает инфраструктуру быстрой и надёжной
Открыт к общению и проектам, написать мне можно через форму или в личном сообщении

❗ Если есть пожелания по обзору какого-либо вопроса не представленного на сайте - пиши в комментариях

Комментарии

Нет комментариев для отображения.

Информация о статье

Автор
Guru
Время чтения статьи
14 мин чтения
Просмотры
455
Посл. обновление

Ещё в Размышления системного администратора

Ещё от Guru

Поделиться этой статьёй

Назад
Верх