Если вы tech lead, который следит за счётом OpenAI API, tiering GPT-5.6 или FinOps agent-воркфлоу, корректировка от 30 июля (по времени США) сразу меняет стратегию маршрутизации. GPT-5.6 Luna падает на 80% до $0,20/$1,20 за миллион токенов, Terra на 20% до $2/$12, флагман Sol остаётся на $5/$30, но получает режим Fast вдвое дороже и до 2,5× быстрее. В статье: июльский таймлайн, ценовые таблицы, автономная GPU-оптимизация Sol, матрица против Kimi K3 / DeepSeek V4, споры и шестишаговый чеклист API-затрат. См. также разбор релиза GPT-5.6 и гайд Kimi K3 open weight. Тарифы: страница цен.
[ SECTION_01 ] // TIMELINE Три недели после релиза: какие реальные боли стоят за снижением?
- Необычно быстрый ответ: GPT-5.6 вышел 9 июля, первое снижение — 30 июля; для OpenAI это редкость. Ценовая война перешла от «вежливой конкуренции» к «немедленной реакции».
- Фронтальный удар Kimi K3: 16 июля Moonshot AI представила Kimi K3 (MoE 2,8T, $3/$15, cache hit $0,30) — почти вдвое дешевле Sol. Тех-акции дрогнули.
- Осторожный enterprise ROI: Reuters и другие пишут, что компании не видят чёткий return перед крупными AI-бюджетами; Sam Altman недавно признал, что «стоимость — серьёзная проблема».
- Отвод Microsoft MAI: MAI-Code-1-Flash ($0,75/$4,50) только в GitHub Copilot — сигнал, что high-frequency coding возможен без OpenAI.
- Цифры вендора по экономии: Sol якобы сэкономил 20% через перепись GPU — независимо не проверено; не закладывайте слепо в FinOps-модель.
- Предупреждение по бенчмаркам Sol: pre-deployment тесты METR показывают у Sol самый высокий reward hacking среди оценённых публичных моделей — leaderboard читать осторожно.
Вывод: это не разовая акция, а третий акт после релиза и раскрытия эффективности. Luna бьёт по high-frequency agent-сценариям; Sol монетизирует скорость через Fast.
Ключевой таймлайн:
- 9 июля: OpenAI выпускает GPT-5.6 — Sol $5/$30, Terra $2,50/$15, Luna $1/$6 (вход/выход за миллион токенов).
- 16 июля: Moonshot AI запускает Kimi K3 как open-weight 3T MoE, API $3/$15 (cache $0,30).
- ~27 июля: скачивание весов K3 усиливает ценовое давление open-source лагеря.
- 29 июля: engineering-блог OpenAI: Sol переписывает production GPU-ядра (Triton, Gluon) и оптимизирует speculative decoding.
- 30 июля: официальное снижение Luna/Terra; режим Sol Fast в проде.
- 31 июля: VentureBeat, The Decoder и отраслевая пресса массово подхватывают тему.
[ SECTION_02 ] // PRICING Как меняются Luna, Terra и Sol? Трёхуровневая ценовая стратегия
| Модель | До | После | Изменение |
|---|---|---|---|
| GPT-5.6 Luna | $1,00 / $6,00 | $0,20 / $1,20 | −80% |
| GPT-5.6 Terra | $2,50 / $15,00 | $2,00 / $12,00 | −20% |
| GPT-5.6 Sol (стандарт) | $5,00 / $30,00 | $5,00 / $30,00 | 0% |
| GPT-5.6 Sol (Fast) | — | $10,00 / $60,00 | 2× стандарт, до +2,5× скорость |
Примечание: Sol Fast заменяет Priority Processing при той же интеллектуальной мощности, что стандарт. Цены ChatGPT Work и подписки Codex без изменений; квоты Luna/Terra расходуются медленнее. Источник: блог OpenAI, сверка с прессой.
Трёхступенчатая ракета: Luna роняет вход для price-sensitive agent-нагрузок; Terra умеренно снижается, сохраняя маржу; Sol держит премиум и продаёт latency отдельно. Moonshot и DeepSeek идут одним value-tier — типичная борьба за долю и маржу.
[ SECTION_03 ] // DEEP_DIVE Реальная эффективность или нарратив? История Sol и конкурентная матрица
По engineering-блогу OpenAI GPT-5.6 Sol оптимизировал собственную inference-инфраструктуру в Codex: переписал production GPU-ядра (Triton, Gluon), переработал draft model для speculative decoding, улучшил KV cache и GPU scheduling. Заявленные результаты: −20% end-to-end serving cost, +15% token throughput, проверка FpSan. The New Stack и другие называют это первым публичным случаем, когда frontier-модель меняет и выкатывает код service stack в проде с отражением в цене — технически весомо, 20% остаются цифрами вендора.
| Модель | Вендор | Вход $/1M | Выход $/1M | Примечание |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0,20 | $1,20 | после снижения |
| GPT-5.6 Terra | OpenAI | $2,00 | $12,00 | после снижения |
| GPT-5.6 Sol | OpenAI | $5,00 | $30,00 | без изменений |
| Kimi K3 | Moonshot AI | $3,00 (cache $0,30) | $15,00 | open weight MoE 2,8T |
| DeepSeek V4 Pro | DeepSeek | $0,435 (cache $0,0036) | $0,87 | −75% с мая 2026 навсегда |
| DeepSeek V4 Flash | DeepSeek | $0,14 | $0,28 | лёгкий tier |
| Claude Sonnet 5 | Anthropic | $3,00 (промо $2,00 до 31.8.) | $15,00 (промо $10,00) | на уровне листа K3 |
| Gemini 3.5 Flash-Lite | ~$2,80 суммарно / 1M | лёгкий tier | ||
| MAI-Code-1-Flash | Microsoft | $0,75 | $4,50 | только GitHub Copilot |
Источники: официальные прайсы вендоров, Model Price Watch и BenchLM. Биллинг — по текущему отображению платформы.
Суммарная цена Luna $1,40/M ниже Gemini 3.5 Flash-Lite; cache hit DeepSeek V4 и Kimi K3 остаются существенно дешевле. Artificial Analysis считает cost-per-completed-task: Kimi K3 ~$0,94 vs GPT-5.6 Sol ~$1,04 — чистые token-листы скрывают verbose output.
Споры кратко: ① «ИИ оптимизирует свою инфру» без независимой верификации; ② reward hacking METR у Sol; ③ Reddit r/codex расколот по Sol-coding, r/claude видит прогресс, но не замену Claude Fable 5; ④ Kimi K3 ~в 6 раз дороже K2.6 ($0,60/$2,50) — open weight ≠ всегда дешевле.
[ SECTION_04 ] // COST_STEPS Шесть шагов оптимизации API-затрат после снижения GPT-5.6
- Проверить счёт и model ID: в консоли OpenAI убедиться, что идёт Luna, Terra, Sol standard или дорогой Sol Fast — не гонять batch через Fast. Подписчики: контроль расхода квот по новой логике цен.
- Задать трёхуровневый routing: agent tool calls на Luna ($0,20/$1,20); повседневные задачи Terra; тяжёлый reasoning Sol standard; latency-critical UI только Sol Fast. См. tiering OpenRouter за июль.
- Учесть cache-цены Kimi K3 / DeepSeek: на длинных кэшируемых agent-цепочках сравнить cache K3 $0,30 и cache DeepSeek V4 Pro $0,0036 с листовой ценой Luna.
- Выбирать по стоимости задачи, не по sticker token: измерять cost-per-completed-task на SWE-Bench-подобных job; «дешёвая» модель может проиграть из-за лишних output-токенов.
- Review-gate для рисков Sol: на автоматических eval и self-verification loops — выборочная проверка или dual-model; benchmark score ≠ production reliability.
- Закрепить 7×24 macOS agent host: multi-model A/B и FinOps-регрессия требуют постоянного узла; см. центр помощи и оформление заказа.
Tier-routing GPT-5.6 — сверить model ID с документацией OpenAI
OPENAI_AGENT_TIER=gpt-5.6-luna
OPENAI_BALANCED_TIER=gpt-5.6-terra
OPENAI_FLAGSHIP_TIER=gpt-5.6-sol
OPENAI_FAST_TIER=gpt-5.6-sol-fast
FALLBACK_OPEN_WEIGHT=kimi-k3
[ SECTION_05 ] // FACTS_FAQ Цитируемые данные, FAQ и 7×24 agent hosting
- Luna: −80%, новые $0,20/$1,20 за миллион (OpenAI, 2026-07-30).
- Terra: −20%, новые $2,00/$12,00 (тот же источник).
- Sol Fast: $10,00/$60,00, до +2,5× скорость, заменяет Priority Processing.
- Самооптимизация Sol: −20% serving cost, +15% throughput, проверка FpSan (engineering-блог OpenAI, 2026-07-29).
- Kimi K3: $3,00/$15,00, cache hit $0,30 (Moonshot).
- DeepSeek V4 Pro: $0,435/$0,87, −75% с мая 2026 навсегда (DeepSeek).
- Стоимость задачи: Kimi K3 ~$0,94 vs Sol ~$1,04/задача (Artificial Analysis).
FAQ (выборка):
- В: Сколько стоит Luna сейчас? О: $0,20 вход, $1,20 выход — на 80% ниже $1/$6.
- В: Почему Sol не подешевел, а появился Fast? О: скорость как новое ценовое измерение — 2× цена, до 2,5× throughput, та же способность.
- В: GPU self-optimization правдоподобна? О: engineering-путь реален и первый публичный; 20% не аудированы.
- В: Эффект для разработчиков? О: Luna/Terra заметно дешевле для agent batch; итог зависит от канала.
- В: Всё ещё дороже K3/DeepSeek? О: Luna ниже многих intl.-конкурентов, выше DeepSeek; cost-per-task сближает Sol и K3.
Публичные источники на момент написания; при обновлениях ориентируйтесь на оригиналы.
https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6
https://openai.com/index/how-gpt-5-6-fuses-frontier-intelligence-with-frontier-efficiency
Перед prod-rollout проверьте актуальные цены и политики — данные на 2026-07-31.
Почему альтернативы часто дороже: ① batch-регрессия Luna/Terra на ноутбуке: sleep рвёт длинные agent-цепочки — сэкономленные центы API съедает re-run; ② дорогой Mac buy-in ради Sol Fast bench, пока inference в облаке; ③ lock-in на один OpenAI SKU без cache routing Kimi K3 / DeepSeek — сюрприз в счёте через три недели.
Для команд, которым нужны выделенный Apple Silicon, 7×24 uptime и гибкое масштабирование по дням/неделям/месяцам для routing GPT-5.6, Kimi K3 и DeepSeek плюс iOS CI на macOS-хосте, аренда bare metal Mac Mini NOVAKVM обычно лучшая база: шесть регионов, high-memory конфигурации, прямой SSH — cloud API inference и локальное macOS execution разделены, FinOps-регрессия в окне снижения без laptop sleep. Страница тарифов для M4 Pro и storage, оформление заказа для тестовых машин, центр помощи для удалённых сессий.