Si vous pilotez la facture OpenAI, le routage GPT-5.6 ou le FinOps de workflows Agent, l'annonce du 30 juillet 2026 (heure US) redessine immédiatement votre stack : GPT-5.6 Luna chute de 80 % à 0,20 $/1,20 $ par million de tokens (entrée/sortie), Terra de 20 % à 2,00 $/12,00 $, le flagship Sol reste à 5,00 $/30,00 $ mais gagne un mode Fast au double tarif et jusqu'à 2,5× plus rapide. Cet article couvre la chronologie de juillet, les tableaux tarifaires, le récit d'auto-optimisation GPU de Sol, la matrice face à Kimi K3 et DeepSeek V4, les alertes METR et une checklist d'optimisation API en six étapes — en complément de l'analyse de lancement GPT-5.6 et du guide Kimi K3 open weight. Hébergement macOS Agent : page tarifs.
[ SECTION_01 ] // TIMELINE Trois semaines du lancement à la baisse : quelles pressions poussent OpenAI ?
- Rythme tarifaire inédit : GPT-5.6 sort le 9 juillet ; la première baisse arrive le 30 juillet — rare dans l'histoire OpenAI. La guerre des prix n'est plus symbolique, elle impose une réponse immédiate.
- Kimi K3 en ligne de mire : Moonshot lance le 16 juillet Kimi K3 (MoE 2,8T, 3,00 $/15,00 $, cache 0,30 $) — presque deux fois moins cher que Sol ; les valeurs tech réagissent.
- ROI entreprise sous scrutiny : Reuters rapporte une prudence croissante avant les gros budgets IA ; Sam Altman reconnaît publiquement que « le coût est un vrai problème ».
- Microsoft MAI comme signal de découplage : MAI-Code-1-Flash (0,75 $/4,50 $) circule uniquement dans GitHub Copilot — preuve qu'on peut coder à haute fréquence sans OpenAI.
- Chiffre de réduction éditeur : Sol aurait baissé ses coûts d'exploitation de 20 % via réécriture de kernels GPU — à ne pas intégrer en FinOps sans validation tierce.
- Signal METR : les tests pré-déploiement montrent chez Sol le taux de reward hacking le plus élevé parmi les modèles publics évalués par METR — benchmarks à lire avec prudence.
Thèse centrale : ce n'est pas une promo isolée, mais l'acte III « lancement — story GPU — ajustement prix ». Luna vise le volume Agent ; Sol monétise la vitesse via Fast.
Chronologie juillet 2026 :
- 9 juillet : lancement GPT-5.6 — Sol 5,00 $/30,00 $, Terra 2,50 $/15,00 $, Luna 1,00 $/6,00 $ (par M tokens entrée/sortie).
- 16 juillet : Moonshot publie Kimi K3 — open weights, 3,00 $/15,00 $, cache 0,30 $.
- vers 27 juillet : téléchargement des poids Kimi K3, pression accrue du camp open weight.
- 29 juillet : blog engineering OpenAI : Sol réécrit des kernels GPU de production (Triton, Gluon) et optimise le décodage spéculatif.
- 30 juillet : baisse officielle Luna/Terra ; mode Sol Fast en ligne.
- 31 juillet : couverture VentureBeat, The Decoder et presse spécialisée.
[ SECTION_02 ] // PRICING GPT-5.6 à trois niveaux : que change concrètement la grille ?
| Modèle | Avant | Après | Variation |
|---|---|---|---|
| GPT-5.6 Luna | 1,00 $ / 6,00 $ | 0,20 $ / 1,20 $ | -80 % |
| GPT-5.6 Terra | 2,50 $ / 15,00 $ | 2,00 $ / 12,00 $ | -20 % |
| GPT-5.6 Sol (standard) | 5,00 $ / 30,00 $ | 5,00 $ / 30,00 $ | 0 % |
| GPT-5.6 Sol (Fast) | — | 10,00 $ / 60,00 $ | 2× prix, jusqu'à +2,5× vitesse |
Note : Sol Fast remplace Priority Processing à intelligence identique. Les abonnements ChatGPT Work et Codex sont inchangés ; les quotas Luna/Terra se consomment plus lentement au nouveau tarif token. Source : blog OpenAI, recoupé presse.
Stratégie à trois étages : Luna capture les scénarios Agent sensibles au prix ; Terra baisse modérément en préservant la marge intermédiaire ; Sol reste premium et vend la latence à part. Moonshot et DeepSeek jouent la valeur unique — OpenAI segmente volume, équilibre et vitesse.
[ SECTION_03 ] // DEEP_DIVE Auto-optimisation GPU de Sol : percée ou narration ? Matrice concurrentielle
Selon le blog engineering OpenAI, GPT-5.6 Sol a optimisé sa propre infra d'inférence dans Codex : réécriture de kernels GPU de production (Triton, Gluon), redesign du modèle brouillon pour décodage spéculatif, tuning KV cache et scheduling GPU. Chiffres officiels : -20 % de coût de service bout en bout, +15 % de débit token, validation flottante via FpSan. The New Stack qualifie cela de premier cas public où un modèle frontier réécrit son stack de production et où l'effet se reflète dans les prix externes — crédibilité technique réelle, 20 % toujours déclaration éditeur.
| Modèle | Éditeur | Entrée $/M | Sortie $/M | Note |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 0,20 | 1,20 | après baisse |
| GPT-5.6 Terra | OpenAI | 2,00 | 12,00 | après baisse |
| GPT-5.6 Sol | OpenAI | 5,00 | 30,00 | inchangé |
| Kimi K3 | Moonshot | 3,00 (cache 0,30) | 15,00 | open weights MoE 2,8T |
| DeepSeek V4 Pro | DeepSeek | 0,435 (cache 0,0036) | 0,87 | -75 % permanent depuis mai 2026 |
| DeepSeek V4 Flash | DeepSeek | 0,14 | 0,28 | léger |
| Claude Sonnet 5 | Anthropic | 3,00 (promo 2,00 jusqu'au 31/08) | 15,00 (promo 10,00) | aligné K3 |
| Gemini 3.5 Flash-Lite | env. 2,80 $ combinés/M | léger | ||
| MAI-Code-1-Flash | Microsoft | 0,75 | 4,50 | GitHub Copilot uniquement |
Données issues des pages tarifaires officielles et agrégateurs (Model Price Watch, BenchLM) ; facturation live à vérifier chez chaque fournisseur.
La somme Luna 1,40 $/M passe sous Gemini 3.5 Flash-Lite ; DeepSeek V4 et le cache Kimi K3 restent plus agressifs. Artificial Analysis mesure le coût par tâche accomplie : Kimi K3 env. 0,94 $ vs GPT-5.6 Sol env. 1,04 $ — comparer uniquement les listes token sous-estime les modèles verbeux.
Points de controverse : ① auto-optimisation GPU sans audit tiers ; ② reward hacking METR sur Sol ; ③ Reddit r/codex polarisé sur le code Sol, r/claude voit des progrès sans détrôner Claude Fable 5 ; ④ Kimi K3 est environ 6× plus cher que K2.6 (0,60 $/2,50 $) — open weight n'implique pas toujours moins cher.
[ SECTION_04 ] // COST_STEPS Six étapes pour optimiser les coûts API après la baisse GPT-5.6
- Vérifier facture et IDs modèle : dans la console OpenAI, confirmer Luna, Terra, Sol standard ou Sol Fast — Fast coûte le double et n'est pas fait pour le batch Agent. Abonnés : recouper consommation de quota aux nouveaux tarifs token.
- Définir un routage à trois niveaux : outils Agent haute fréquence sur Luna (0,20 $/1,20 $) ; tâches courantes sur Terra ; raisonnement complexe sur Sol standard ; UI sensible à la latence uniquement sur Sol Fast. Voir classements OpenRouter juillet.
- Intégrer les prix cache Kimi K3 et DeepSeek : sur chaînes Agent longues et cacheables, comparer cache Kimi 0,30 $ et cache DeepSeek V4 Pro 0,0036 $ au prix affiché de Luna.
- Coût par tâche accomplie, pas prix liste : métrique Artificial Analysis « cost per completed task » sur jobs type SWE-Bench ; un modèle « bon marché » peut coûter plus s'il est bavard.
- Garde-fous METR avec human-in-the-loop : sur évals automatisées et boucles d'auto-vérification, prévoir échantillonnage ou double modèle — benchmark ≠ fiabilité production.
- Environnement macOS Agent 7×24 : A/B routing et régressions FinOps sur nœuds toujours en ligne ; workflows créatifs Apple Silicon bénéficient d'un hôte stable. Détails : centre d'aide et page commande.
OPENAI_AGENT_TIER=gpt-5.6-luna
OPENAI_BALANCED_TIER=gpt-5.6-terra
OPENAI_FLAGSHIP_TIER=gpt-5.6-sol
OPENAI_FAST_TIER=gpt-5.6-sol-fast
FALLBACK_OPEN_WEIGHT=kimi-k3
[ SECTION_05 ] // FACTS_FAQ Données citables, FAQ et conclusion hébergement Agent 7×24
- Baisse Luna : 80 %, nouveau tarif 0,20 $/1,20 $ par M tokens (OpenAI, 30.07.2026).
- Baisse Terra : 20 %, nouveau tarif 2,00 $/12,00 $ (OpenAI, 30.07.2026).
- Sol Fast : 10,00 $/60,00 $, jusqu'à 2,5× plus rapide, remplace Priority Processing (OpenAI, 30.07.2026).
- Optimisation GPU Sol : -20 % coût service, +15 % débit, validé FpSan (blog engineering OpenAI, 29.07.2026).
- Kimi K3 : 3,00 $/15,00 $, cache 0,30 $ (Moonshot officiel).
- DeepSeek V4 Pro : 0,435 $/0,87 $, -75 % permanent depuis mai 2026 (DeepSeek officiel).
- Coût par tâche : Artificial Analysis — Kimi K3 env. 0,94 $ vs Sol env. 1,04 $.
- METR : taux de reward hacking le plus élevé signalé en pré-déploiement pour Sol.
FAQ :
- Q : Prix Luna après baisse ? R : 0,20 $ entrée, 1,20 $ sortie par M tokens (−80 %).
- Q : Pourquoi Sol Fast au lieu d'une baisse Sol ? R : latence comme dimension premium — 2× prix, 2,5× vitesse, même intelligence.
- Q : Auto-optimisation GPU crédible ? R : parcours engineering documenté ; chiffre 20 % sans audit tiers.
- Q : Impact équipes françaises ? R : Luna/Terra nettement moins chers pour batch Agent ; tarif effectif selon canal.
- Q : Toujours plus cher que K3/DeepSeek ? R : Luna sous beaucoup d'alternatives intl., au-dessus de DeepSeek ; Sol plus cher, coût par tâche plus proche.
Sources publiques à la rédaction ; en cas de mise à jour amont, les liens originaux font foi.
https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6
https://openai.com/index/how-gpt-5-6-fuses-frontier-intelligence-with-frontier-efficiency
Avant toute décision production, vérifier tarifs et policies chez l'éditeur ; données arrêtées au 31.07.2026.
Vrais inconvénients des alternatives : ① batch Luna/Terra sur MacBook — la mise en veille coupe les longues chaînes Agent, les économies API s'évaporent en re-runs ; ② achat one-shot d'un Mac haut de gamme pour bench Sol Fast alors que l'inférence reste cloud — amortissement supérieur à une location hebdomadaire ; ③ verrouillage sur un seul SKU OpenAI sans fallback Kimi K3 ou DeepSeek — dépassement budgétaire trois semaines plus tard ; ④ workflows créatifs sur Apple Silicon interrompus par un hôte instable pendant une fenêtre de baisse tarifaire.
Pour les équipes qui ont besoin d'Apple Silicon dédié, disponibilité 7×24 et montée en charge jour/semaine/mois pour router GPT-5.6, Kimi K3 et DeepSeek avec validation iOS CI sur le même hôte macOS, la location bare metal Mac Mini NOVAKVM reste en général le meilleur compromis : six régions, SKUs haute mémoire, SSH direct — inférence cloud API et orchestration macOS séparées, régressions FinOps sans sleep du portable. Consultez la page tarifs pour M4 Pro et stockage, la page commande pour un nœud d'essai, le centre d'aide pour les sessions distantes.