LLM для длинных документов

Договоры, книги, PDF — за один запрос
в России

Qwen 3.5 397B поддерживает до 262 144 токенов нативного контекста в одном запросе. Более длинные документы нужно разбивать, выбирать через retrieval или компактить. Данные обрабатываются в российском дата-центре.

262K
токенов в одном запросе
Native
без YaRN-расширения
0.06 ₽
input за 1K токенов
RAG
для документов длиннее окна

Что обрабатываем

4 типа задач для длинного контекста

Договоры и контракты

200-страничный договор целиком в одном промпте. Найди в нём пункты про штрафы, условия расторжения, сроки оплаты.

  • Юридический due diligence
  • Сравнение редакций договора
  • Извлечение ключевых условий

Книги и длинные PDF

Целая книга или научная статья за один запрос. Не нужно резать на куски и собирать ответ.

  • Конспект книги
  • Поиск ответа в учебнике
  • Анализ научной литературы

Корпоративная документация

Регламенты, нормативы, методички, политики — модель видит всё одновременно.

  • Q&A по внутренней базе знаний
  • Compliance-проверки
  • Обучение новых сотрудников

Кодовые базы

Загрузи монорепозиторий и спрашивай — где у нас обрабатывается X, как устроен модуль Y.

  • Code review длинного PR
  • Объяснение архитектуры
  • Поиск багов в legacy-коде

Как это работает

Загружаешь PDF, задаёшь вопрос — получаешь ответ

analyze-contract.py
import os
from openai import OpenAI
import pdfplumber

# 1. Извлекаем текст из 200-страничного договора
with pdfplumber.open("contract.pdf") as pdf:
    contract = "\\n".join(p.extract_text() for p in pdf.pages)

# 2. Спрашиваем модель — весь документ в одном промпте
client = OpenAI(base_url="https://api.42gpu.ru/vllm/v1", api_key=os.environ["GPU42_API_KEY"])
response = client.chat.completions.create(
    model="Qwen/Qwen3.5-397B-A17B-FP8",
    messages=[{
        "role": "user",
        "content": f"Договор:\\n{contract}\\n\\nНайди условия о штрафах и расторжении."
    }],
)

print(response.choices[0].message.content)

Считайте объём токенами, а не страницами: input вместе с зарезервированным output должен помещаться в общий лимит 262144. Для больших наборов используйте chunking и retrieval.

Вопросы про обработку документов

Старт за 2 минуты

Получите ключ для теста на своём документе

Email + пароль, canonical API key и точный model ID. Цена зависит от фактического token usage.

  • До 262K общего контекста
  • Данные в РФ
  • Документированный Chat Completions