Frontier models и cost-routing: как не превращать ценовой snapshot в billing authority
Cost-routing полезен как архитектурный принцип, но статическая таблица моделей, цен, context limits и «лучших» ролей быстро устаревает. Эта редакция сохраняет метод: выбирать достаточную модель по измеренному workload, актуальной цене и ограничениям, а не по замороженному рейтингу середины 2026 года.
Почему старый matrix нельзя считать текущим
Первичные vendor docs уже демонстрируют drift относительно восстановленной таблицы: Google обновляла Gemini Flash lineup и pricing; xAI изменила модельный ряд и после Grok 4.3 выпустила Grok 4.5; DeepSeek публикует отдельные cache-hit/cache-miss цены и прямо предупреждает, что цены могут меняться. Даже когда конкретная строка сегодня совпадает с vendor page, это не превращает её в долговечный billing contract.
Поэтому публичная страница не воспроизводит полный «актуальный прайс-лист». Она фиксирует источник и дату проверки, а оперативный router должен получать model ID, цену и limits из свежего provider authority или контролируемого registry snapshot.
Нормальный cost-routing contract
- Capability gate: сначала определить обязательные возможности задачи — reasoning, coding, vision, tool use, structured output, context size, latency/SLA и safety/access constraints.
- Current vendor state: привязать exact model ID, availability, rate limits, context/output limits и pricing к timestamp и первичному provider source.
- Workload evidence: сравнивать модели на собственном representative eval set, а не по одной vendor benchmark chart.
- Total cost: учитывать input, cached input, output/reasoning, tools/search, retries, long-context tiers, batch/priority modes и provider-specific surcharges, если они применимы.
- Fallback: заранее определить поведение при retirement, alias redirect, quota exhaustion, region/provider outage или резком изменении цены.
- Authority: router может рекомендовать или выбирать внутри заранее разрешённого model pool, но не должен сам покупать plan, повышать billing limit или добавлять нового платного provider без отдельного разрешения.
Что подтверждает volatile nature прямо сейчас
- OpenAI публикует GPT‑5.5 как API model с отдельными standard, cached-input и long-context pricing rules. Это пример того, почему одной пары input/output чисел недостаточно для полного cost estimate.
- Google публикует stable и preview Gemini models раздельно; актуальная models/pricing surface уже отличается от более раннего mid-2026 matrix.
- xAI документирует Grok 4.3 и последующий Grok 4.5, а migration docs показывают, что retired aliases могут перенаправляться на другой model с другим billing.
- DeepSeek V4 pricing разделяет cache-hit и cache-miss input и отдельно указывает output price, одновременно рекомендуя регулярно проверять страницу на изменения.
Эти примеры нужны не для нового вечного рейтинга. Они доказывают, что routing registry должен быть versioned, timestamped и revalidated.
Цена ≠ качество, benchmark ≠ ваш workload
«Самая дешёвая достаточная модель» определяется только после task-specific evaluation. Для agentic workload полезно измерять completion success, verifier acceptance, tool-call correctness, latency distribution, token consumption, retry rate и failure severity. Vendor benchmarks можно использовать как discovery evidence, но не как автоматический production-ranking.
Фиксированные tiers вроде commodity / interactive / high-stakes могут быть удобной policy abstraction, однако принадлежность конкретной модели к tier должна следовать из текущего eval и governance, а не из названия модели или старой таблицы.
Первичные provider sources, проверено 2026-08-15
- OpenAI API · GPT‑5.5 model — current model ID, context/output limits and token pricing surface.
- Google Gemini API · Models и Pricing — current stable/preview lineup and provider pricing.
- xAI · Models, Grok 4.3 и Grok 4.5 announcement — current lineup plus later model release.
- DeepSeek API · Models & Pricing — cache-hit/cache-miss/output pricing and explicit price-change warning.
- Anthropic · Claude Fable — vendor product surface; exact billing/access remains independently revalidated.
Допустимая область использования
Используйте страницу как specification для versioned model registry и workload router. Перед operational decision обновите provider facts, пересчитайте total cost на реальном token/tool profile и прогоните текущий eval set.
Эта страница не является разрешением на покупку подписки, увеличение billing limit, добавление платного provider, deployment или автоматическое изменение production model routing.