См. также: подготовка к GPT-5.6, OpenAI июль 2026, Gemini 3.5 vs GPT-5.6. Рекомендуемый tier для sandbox: 512 ГБ / 24 ГБ на странице тарифов.
Три барьера: почему «один tier на всё» обходится дорого
1. Скрытая стоимость Luna. Luna с контекстом 1,5M токенов стоит в 8–15× дороже Sol. Если отправить каждый запрос в Luna «на всякий случай», API-бюджет Q3 2026 вырастет без прироста качества на коротких задачах.
2. Latency vs качество. Sol даёт TTFT P50 ~180 ms — на 35–50% быстрее Terra. Real-time Agent на Luna получит P95 >2 с и потеряет пользователей раньше, чем вы увидите uplift в reasoning.
3. Риск ключей при A/B. Три model ID на локальном ноутбуке — prompt-injection через tool call к credentials. Compliance закроет параллельное тестирование, если audit log и API keys не изолированы на dedicated host.
Матрица Sol / Terra / Luna: производительность и сценарии
Семь измерений для архитектурного решения до фиксации production routing.
| Измерение | Sol ☀️ | Terra 🌍 | Luna 🌙 |
|---|---|---|---|
| Контекст | 128K | 512K | 1,5M токенов |
| TTFT P50 | ~180 ms | ~310 ms | ~480 ms |
| SWE-Bench Pro | ~64% | ~72% | ~68% (глубина reasoning) |
| Tool call параллелизм | До 16 parallel | До 8 | До 4 (строгий schema) |
| Мультимодальность | Image + text | Image + code | Real-time audio-video |
| Input $/1M | ~$0,35 | ~$0,90 (база 1×) | ~$2,50 |
| Типичный workload | Agent bot · tool loop | SaaS chat · code assist | Legal/medical RAG · spec |
Routing-вывод: Sol — tool-циклы и real-time; Terra — default для 70% запросов; Luna — только когда контекст >400K или нужен frame-level video. Гибридный паттерн «Sol loop + Terra summary + Luna fallback» снижает spend на 40–55%.
Технический разбор: архитектура GPT-5.6 2.0 и пределы tier
| Компонент | Технический принцип | Предел производительности | Влияние на TCO |
|---|---|---|---|
| Native Multimodal 2.0 | Единый token stream для image/video/audio без vision-encoder bottleneck | −31% latency vs GPT-5.5 vision pipeline | Минус отдельный embedding tier |
| Alignment Fix | Коррекция instruction drift на уровне routing layer | −22% hallucination на 1M+ контексте | Меньше human review в compliance |
| Tier Router API | Автовыбор Sol/Terra/Luna по token budget и latency SLA | P95 routing overhead <12 ms | −40% overspend на Luna |
| Agent Workflow 2.0 | Stateful multi-step с checkpoint между tier | −28% failed tool chains vs 5.5 | Минус custom orchestrator glue |
Матрица решений: какой tier под вашу команду
| Профиль команды | Рекомендуемый tier | Метод валидации |
|---|---|---|
| Real-time Agent / support bot | Sol primary | 24h shadow traffic, P95 <400 ms |
| Универсальный SaaS-чат | Terra default | Сравнить refusal rate с GPT-5.5 |
| Legal / medical long-doc RAG | Luna (с 128K smoke) | Escalate только при retrieval fail |
| Multimodal creative pipeline | Luna + Sol routing | Frame-level video benchmark |
| Platform team A/B | Все три tier | Единый eval runner на vpshalo M4 |
Шесть шагов SOP: A/B Sol, Terra, Luna до production
- Шаг 1 — Зафиксировать benchmark: 25 code-задач, 15 long-doc RAG, 10 Agent tool-loop и 5 multimodal flow; записать baseline GPT-5.5 Terra.
- Шаг 2 — Включить три model ID:
gpt-5.6-sol,gpt-5.6-terra,gpt-5.6-lunaв OpenAI dashboard; проверить rate limits по tier. - Шаг 3 — Изолированный Mac: Открыть страницу заказа, выбрать region, Mac mini M4 512 ГБ / 24 ГБ. API key — только на remote host.
- Шаг 4 — SDK и eval runner: По SSH установить OpenAI Python SDK v2, LangSmith или in-house runner; единый prompt template для всех tier.
- Шаг 5 — Параллельный прогон: Автоматически прогнать benchmark по Sol/Terra/Luna; сравнить latency, cost per task, success rate, hallucination rate.
- Шаг 6 — Production routing: Sol → tool loop, Terra → default, Luna → fallback >400K. Архивировать отчёт, затем мигрировать primary tier.
Цитируемые данные для architecture review
FAQ: GPT-5.6 Sol, Terra, Luna
Q: Можно ли оставить только Terra и не трогать Sol/Luna? Да, если нет real-time Agent и документы <400K. Но вы переплатите на latency-sensitive задачах и не получите long-context без Luna fallback.
Q: Один Mac потянет A/B трёх tier? Да. 512 ГБ SSD — SDK, benchmark-наборы, логи. 24 ГБ RAM — local embedding для RAG baseline и smoke-тесты.
Q: ChatGPT Plus уже включает все три tier? Plus даёт Terra default; Sol и Luna — через API или Team/Enterprise с tier routing. Для production нужен API key и scenario router.
Итог: GPT-5.6 открыт — выбирайте tier по данным, не по названию
Полное открытие GPT-5.6 меняет правила: Sol — скорость и Agent, Terra — универсальный default, Luna — длинный контекст и multimodal flagship. Универсального «лучшего» tier нет — есть маршрут под workload.
Рациональный ход июля 2026: идентичный benchmark по Sol/Terra/Luna, изолированный sandbox, затем гибридный routing с budget cap на Luna. Не переключайте production до собственного eval pass.
Рекомендация по покупке: откройте vpshalo, выберите supported region, tier Mac mini M4 512 ГБ / 24 ГБ, подключитесь по SSH сегодня. Разверните OpenAI SDK и eval runner на dedicated bare metal — API key изолирован на remote node, cancel anytime после A/B. Гибче покупки hardware под временное окно миграции на GPT-5.6.