Цены и баланс
Тарификация canonical inference API в рублях по фактическому token usage.
Текущая цена
| model | Input | Output | Валюта |
|---|---|---|---|
Qwen/Qwen3.5-397B-A17B-FP8 | 0.06 ₽ / 1K | 0.32 ₽ / 1K | RUB |
Что считается
Input tokens
Prompt, история messages, tool schemas и другие части запроса, учтённые upstream в prompt_tokens.
Output tokens
Весь completion output: reasoning, финальный content и tool calls, отражённые в completion_tokens.
Пример расчёта
1000 input + 500 output = 1000 / 1000 × 0.06 ₽ + 500 / 1000 × 0.32 ₽ = 0.22 ₽.
{
"usage": {
"prompt_tokens": 1000,
"completion_tokens": 500,
"total_tokens": 1500
}
}Баланс и списание
Перед отправкой upstream backend оценивает стоимость и проверяет баланс. Если его недостаточно, запрос завершается HTTP 402 до генерации.
После ответа стоимость рассчитывается по usage.prompt_tokens и usage.completion_tokens. Если upstream не вернул usage, backend использует локальную оценку и помечает её источником fallback.
Баланс, пополнение и история доступны в Dashboard → Биллинг. Эти account endpoints используют dashboard JWT, а не inference API key.
Недостаточный баланс
{
"error": {
"message": "Insufficient balance",
"code": "insufficient_balance",
"type": "request_error"
}
}Не повторяйте 402 автоматически: сначала пополните баланс или уменьшите ожидаемый output.
Контекст 262144 не меняет цену за токен. max_tokens управляет лимитом output, но списание идёт по фактическому usage. Reasoning может заметно увеличить completion tokens.