См. также: Fable 5 vs GPT-5.5, GPT-5.6 Sol/Terra/Luna, полный разбор релиза Gemini 3.5 Pro. Рекомендуемый tier для multi-model sandbox: 512 ГБ / 24 ГБ на странице тарифов.
Три барьера: почему сезон утечек требует данных, а не хайпа
1. Leaderboard ≠ production. Слухи о Fable 5 указывают на 80,3% SWE-Bench Pro. GPT-5.6 Luna даёт 1,5M контекста. Утечки Gemini 3.5 ставят на 2M токенов плюс multimodal Agents. Один headline-score легко отправит primary API tier не туда.
2. Волатильность квот и compliance. Каждая крупная грейз-неделя перетасовывает rate limits, региональные политики и ценовые tier у всех трёх вендоров. Опоздание на семь дней — и harness придётся переписывать с нуля.
3. Риск ключей и аудита. Три API key на ноутбуке приглашают prompt-injection tool calls к локальным credentials. Compliance-команда закроет параллельное тестирование раньше, чем вы закончите benchmark.
Матрица трёх моделей: Gemini 3.5 Pro vs Fable 5 vs GPT-5.6
Семь ключевых измерений — для архитектурных и закупочных решений до старта грейз-зоны.
| Измерение | Gemini 3.5 Pro (утечка) | Fable 5 | GPT-5.6 (tier Luna) |
|---|---|---|---|
| Контекстное окно | 2M токенов | 200K (extended 512K) | 1,5M токенов |
| Код / SWE | Цель SWE-Bench Pro ~79,5% | ~80,3% (лидирует) | ~72% (Terra выше) |
| Agent-оркестрация | Native multi-Agent + state machine | Computer Use + tool chains | Routing Sol / Terra / Luna |
| Мультимодальность | Frame-level video + screen understanding | Image-text; video ограничен | Luna real-time audio-video |
| Режим рассуждения | Deep Think chain reasoning | Extended Thinking | Alignment Fix + long-chain CoT |
| Input за 1M (слух) | ~$0,95 | ~$3,00 | ~$2,50 (Luna) |
| TTFT P50 (цель) | ~270 ms | ~380 ms | ~310 ms |
Вывод по routing: Fable 5 — рефакторинг и PR review; Gemini 3.5 — full-repo RAG и contract analysis; GPT-5.6 Luna — креативные multimodal pipeline. Не навязывайте одну модель на все workload.
Технический разбор утечек: почему comeback Google правдоподобен
| Компонент | Технический принцип | Предел производительности | Влияние на TCO |
|---|---|---|---|
| Deep Think 2.0 | До 32 шагов chain reasoning с backtrack | Ошибка backtrack −28% vs 3 Pro | Меньше retry в Agent harness |
| Workspace Grounding | Нативная связка Gmail, Docs, Drive | +18% RAG recall по утечкам | Минус self-hosted vector store |
| Code Execution API | Встроенная Python/Shell sandbox в Vertex | Замена внешних runner | −40% glue-кода в harness |
| Multi-Agent Router | Research / Code / Review в одном вызове | −35% латентности vs 3 Pro | Минус custom orchestrator |
Шесть шагов SOP: sandbox A/B трёх моделей
- Шаг 1 — Унифицировать benchmark: 30 code-задач, 20 long-document RAG-запросов и 10 multimodal Agent flow; зафиксировать baseline по каждой модели.
- Шаг 2 — Запросить грейз-доступ: Параллельно включить Vertex AI preview, Anthropic Fable tier и OpenAI GPT-5.6 preview allowlist.
- Шаг 3 — Выделить изолированный Mac: Открыть страницу заказа, выбрать supported region, Mac mini M4 512 ГБ / 24 ГБ. Все три API key — только на remote host.
- Шаг 4 — Развернуть SDK-стек: По SSH установить Gemini Python SDK, Anthropic CLI, OpenAI SDK и единый eval runner (LangSmith или in-house).
- Шаг 5 — Параллельный smoke в день launch: Как только model ID live — автоматически прогнать benchmark; сравнить латентность, стоимость, success rate и hallucination rate.
- Шаг 6 — Routing-решение: Разделить primary/backup по сценарию (код→Fable, RAG→Gemini, креатив→Luna). Архивировать отчёт, затем мигрировать production.
Цитируемые данные для architecture review
FAQ: утечки Gemini 3.5 Pro и выбор модели
Q: Можно ли зашить параметры утечек в SLA? Нет. Оценки и цены могут сдвинуться до GA. Фиксируйте production route только после официального анонса плюс собственного benchmark pass.
Q: Один Mac потянет все три модели? Да. 512 ГБ диска хватает на три SDK-стека, benchmark-наборы и логи. 24 ГБ RAM — local embedding для RAG baseline.
Q: Как командам из restricted region вызывать API? Соблюдайте региональную политику каждого вендора. Арендуйте cloud Mac в supported region, SSH — ключи и audit log только на remote node.
Итог: Google вернулся — но победитель — ваш scenario router
Утечки Gemini 3.5 Pro рисуют контратаку: длинный контекст, агрессивная цена и multimodal Agents. Fable 5 по-прежнему лидирует в глубине кода. GPT-5.6 держит креативные multimodal tier. Универсального чемпиона нет — есть маршрут под ваш workload.
До официального GA рациональный ход — идентичные benchmark, идентичная изоляция и идентичная audit policy по всем трём вендорам, затем распределение API-бюджета H2 2026 на основе данных.
Рекомендация по покупке: откройте vpshalo, выберите supported region, tier Mac mini M4 512 ГБ / 24 ГБ, подключитесь по SSH сегодня. Разверните SDK Gemini, Fable и GPT-5.6 на dedicated bare metal — ключи изолированы на remote node, cancel anytime после A/B. Гибче покупки hardware или GPU-ноды под временное грейз-окно.