Биллинг

Цены и баланс

Тарификация canonical inference API в рублях по фактическому token usage.

Текущая цена

modelInputOutputВалюта
Qwen/Qwen3.5-397B-A17B-FP80.06 ₽ / 1K0.32 ₽ / 1KRUB

Что считается

Input tokens

Prompt, история messages, tool schemas и другие части запроса, учтённые upstream в prompt_tokens.

Output tokens

Весь completion output: reasoning, финальный content и tool calls, отражённые в completion_tokens.

Пример расчёта

1000 input + 500 output = 1000 / 1000 × 0.06 ₽ + 500 / 1000 × 0.32 ₽ = 0.22.

Response fragment
{
  "usage": {
    "prompt_tokens": 1000,
    "completion_tokens": 500,
    "total_tokens": 1500
  }
}

Баланс и списание

Перед отправкой upstream backend оценивает стоимость и проверяет баланс. Если его недостаточно, запрос завершается HTTP 402 до генерации.

После ответа стоимость рассчитывается по usage.prompt_tokens и usage.completion_tokens. Если upstream не вернул usage, backend использует локальную оценку и помечает её источником fallback.

Баланс, пополнение и история доступны в Dashboard → Биллинг. Эти account endpoints используют dashboard JWT, а не inference API key.

Недостаточный баланс

HTTP 402
{
  "error": {
    "message": "Insufficient balance",
    "code": "insufficient_balance",
    "type": "request_error"
  }
}

Не повторяйте 402 автоматически: сначала пополните баланс или уменьшите ожидаемый output.

Контекст 262144 не меняет цену за токен. max_tokens управляет лимитом output, но списание идёт по фактическому usage. Reasoning может заметно увеличить completion tokens.