RAG-система на Qwen 3.5 397B
с контекстом до 262K
Canonical Chat Completions для финального шага вашего RAG. До 262K токенов — большой top-K без агрессивного chunking. Данные в РФ.
(вектор-БД, BM25, гибрид)→42gpu / Qwen 3.5 397B
generator, до 262K контекста→Ответ
Мы — generator-step. Эмбеддинги/retriever — на ваше усмотрение (any embeddings endpoint).
Подключение
LangChain / LlamaIndex — canonical base_url
import os
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(
base_url="https://api.42gpu.ru/vllm/v1",
api_key=os.environ["GPU42_API_KEY"],
model="Qwen/Qwen3.5-397B-A17B-FP8",
)
# Дальше — стандартный RAG chain
retriever = vectorstore.as_retriever()
chain = create_stuff_documents_chain(llm, prompt)
rag = create_retrieval_chain(retriever, chain)import os
from llama_index.llms.openai_like import OpenAILike
llm = OpenAILike(
api_base="https://api.42gpu.ru/vllm/v1",
api_key=os.environ["GPU42_API_KEY"],
model="Qwen/Qwen3.5-397B-A17B-FP8",
context_window=262_144,
)
# Дальше — стандартный QueryEngine
index = VectorStoreIndex.from_documents(docs)
query_engine = index.as_query_engine(llm=llm)Почему именно для RAG
4 причины брать 42gpu как generator-step
Меньше chunking — лучше качество
Контекст до 262K позволяет передавать большой top-K retrieval без агрессивной пересборки. Для более длинных корпусов используйте chunking, reranking и compaction.
OpenAI client / LangChain / LlamaIndex
Подключаются к документированному Chat Completions surface через canonical base_url. Неподдержанные OpenAI endpoints и поля потребуют адаптации.
Данные в РФ
Generator-step работает в российском дата-центре и не отправляет запросы сторонним LLM-провайдерам. Требования к вашему полному RAG-контуру проверяются отдельно.
Тарификация по фактическим токенам
Input стоит 0.06 ₽/1K, output — 0.32 ₽/1K. Reasoning входит в completion tokens.
Вопросы по интеграции
Получите API-ключ — подключите к своему RAG
Email + пароль → готовый ключ. Welcome-кредит 1 000 ₽ хватит на сотни RAG-запросов в тестировании pipeline.
- LangChain / LlamaIndex
- До 262K контекста
- Данные в РФ