LLM-генератор для RAG-системы

RAG-система на Qwen 3.5 397B
с контекстом до 262K

Canonical Chat Completions для финального шага вашего RAG. До 262K токенов — большой top-K без агрессивного chunking. Данные в РФ.

RAG pipeline
Запрос пользователяВаш retriever
(вектор-БД, BM25, гибрид)
42gpu / Qwen 3.5 397B
generator, до 262K контекста
Ответ

Мы — generator-step. Эмбеддинги/retriever — на ваше усмотрение (any embeddings endpoint).

Подключение

LangChain / LlamaIndex — canonical base_url

langchain.py
import os
from langchain_openai import ChatOpenAI

llm = ChatOpenAI(
    base_url="https://api.42gpu.ru/vllm/v1",
    api_key=os.environ["GPU42_API_KEY"],
    model="Qwen/Qwen3.5-397B-A17B-FP8",
)

# Дальше — стандартный RAG chain
retriever = vectorstore.as_retriever()
chain = create_stuff_documents_chain(llm, prompt)
rag = create_retrieval_chain(retriever, chain)
llamaindex.py
import os
from llama_index.llms.openai_like import OpenAILike

llm = OpenAILike(
    api_base="https://api.42gpu.ru/vllm/v1",
    api_key=os.environ["GPU42_API_KEY"],
    model="Qwen/Qwen3.5-397B-A17B-FP8",
    context_window=262_144,
)

# Дальше — стандартный QueryEngine
index = VectorStoreIndex.from_documents(docs)
query_engine = index.as_query_engine(llm=llm)

Почему именно для RAG

4 причины брать 42gpu как generator-step

Меньше chunking — лучше качество

Контекст до 262K позволяет передавать большой top-K retrieval без агрессивной пересборки. Для более длинных корпусов используйте chunking, reranking и compaction.

OpenAI client / LangChain / LlamaIndex

Подключаются к документированному Chat Completions surface через canonical base_url. Неподдержанные OpenAI endpoints и поля потребуют адаптации.

Данные в РФ

Generator-step работает в российском дата-центре и не отправляет запросы сторонним LLM-провайдерам. Требования к вашему полному RAG-контуру проверяются отдельно.

Тарификация по фактическим токенам

Input стоит 0.06 ₽/1K, output — 0.32 ₽/1K. Reasoning входит в completion tokens.

Вопросы по интеграции

Подключение за 2 минуты

Получите API-ключ — подключите к своему RAG

Email + пароль → готовый ключ. Welcome-кредит 1 000 ₽ хватит на сотни RAG-запросов в тестировании pipeline.

  • LangChain / LlamaIndex
  • До 262K контекста
  • Данные в РФ