Большинство моделей в каталоге PlusVibe работают у поставщиков за рубежом. Для многих задач это не проблема, но для части компаний важно, где физически обрабатывается текст запроса. Поэтому в сентябре 2026 года мы добавили модели, которые запускаются на серверах в России: три чат-модели и несколько моделей эмбеддингов.
Ниже — что именно работает в России, как найти эти модели в каталоге и как их вызвать.
Зачем это нужно
Правила обработки данных в PlusVibe описаны на странице «152-ФЗ и данные» и в политике обработки персональных данных. Если коротко:
- ваши собственные данные как клиента — почта, имя или наименование, ИНН, платёжные и технические данные — хранятся и обрабатываются на серверах в России;
- содержимое запросов — промпты и аудио для транскрибации — передаётся поставщикам моделей, в том числе на вычислительные ресурсы за пределами России: в США, Китай и страны Евросоюза;
- содержимое запросов не используется для обучения моделей.
Модели из этой статьи закрывают второй пункт: в нашем каталоге они отмечены как работающие на серверах в России, так что текст запроса к ним не уходит за рубеж. Это полезно, когда в промптах бывают данные клиентов, внутренние документы или переписка, которую вы не хотите отправлять за границу. Подробные правила трансграничной передачи и отзыва согласия — в согласии на обработку данных.
Какие модели работают в России
Чат-модели
Модель id в API Разработчик Qwen3.6 35Bqwen3.6-35b
Alibaba (Qwen)
Qwen3.8 27B
qwen3.8-27b
Alibaba (Qwen)
Kimi K2.6
moonshotai/kimi-k2.6
Moonshot
У каждой из трёх моделей все варианты в каталоге работают в России. Поэтому достаточно указать обычный идентификатор, никакой специальный суффикс не нужен. Размер контекста и возможности модели смотрите на её странице — ссылки в таблице.
Эмбеддинги
id в API Размер вектора Максимум на входfrida
1536
512 токенов
giga-embeddings
2048
4096 токенов
jina-embeddings-v4
2048
32 768 токенов
qwen3-embedding-4b
2560
32 768 токенов
Размер вектора каждой модели мы проверили живым вызовом перед публикацией.
Как найти их в каталоге
На странице /models включите фильтр «Только серверы в РФ». Он работает и на вкладке чат-моделей, и на вкладке «Эмбеддинги». Фильтр строгий: показываются только модели, размещение которых в России подтверждено. Если у модели такой отметки нет, это не значит, что она работает за рубежом — просто у нас нет подтверждённых данных.
Через API тот же список отдаёт GET /v1/model-capabilities?stores_data_in_russia=true (нужен ваш ключ). У каждой модели в ответе есть поле stores_data_in_russia.
Цены
Чат-модели, за 1 млн токенов:
| Модель | Вход | Выход |
|---|---|---|
| qwen3.6-35b | 9 ₽/1M | 51 ₽/1M |
| qwen3.8-27b | 31 ₽/1M | 153 ₽/1M |
| kimi-k2.6 | 125 ₽/1M | 525 ₽/1M |
Эмбеддинги — оплачивается только входящий текст:
| Модель | Вход | Выход |
|---|---|---|
| frida | 4 ₽/1M | 0 ₽/1M |
| giga-embeddings | 7 ₽/1M | 0 ₽/1M |
| jina-embeddings-v4 | 7 ₽/1M | 0 ₽/1M |
| qwen3-embedding-4b | 7 ₽/1M | 0 ₽/1M |
Цены подставляются из каталога в момент открытия страницы.
Пример запроса: чат-модель
Нужен ключ PlusVibe вида sk-pv-… — его можно создать после регистрации. Подойдёт любой OpenAI-совместимый клиент:
curl https://plusvibeapi.ru/v1/chat/completions \
-H "Authorization: Bearer $PLUSVIBE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6-35b",
"messages": [{"role": "user", "content": "Ответь одним словом: столица России?"}],
"max_tokens": 300
}'
Тот же запрос на Python:
import os
from openai import OpenAI
client = OpenAI(
base_url="https://plusvibeapi.ru/v1",
api_key=os.environ["PLUSVIBE_API_KEY"],
)
resp = client.chat.completions.create(
model="qwen3.6-35b",
messages=[{"role": "user", "content": "Ответь одним словом: столица России?"}],
max_tokens=300,
)
print(resp.choices[0].message.content)
Перед публикацией мы отправили этот запрос во все три чат-модели. Каждая ответила «Москва».
Пример запроса: эмбеддинги
docs = [
"Возврат товара возможен в течение 14 дней при сохранении чека.",
"Доставка по Москве занимает один-два рабочих дня.",
]
query = "Сколько дней есть на возврат покупки?"
resp = client.embeddings.create(
model="frida",
input=["search_query: " + query] + ["search_document: " + d for d in docs],
)
vectors = [item.embedding for item in resp.data]
print(len(vectors[0])) # 1536
В этом примере документ про возврат оказался ближе к вопросу, чем документ про доставку, — так и должно быть.
FRIDA и Giga-Embeddings: две модели российской разработки
Среди моделей эмбеддингов на российских серверах две сделаны в России.
FRIDA опубликована в организации ai-forever на Hugging Face, подробный разбор авторы выпустили в блоге SberDevices на Хабре. Модель построена на энкодере FRED-T5 и рассчитана на русский язык. Она ждёт префикс в начале каждого текста: search_query: перед вопросом и search_document: перед фрагментами базы знаний, как в примере выше. Для других задач есть paraphrase: и префиксы вида categorize…: . Окно — 512 токенов, поэтому длинные документы нужно нарезать мелкими кусками.
Giga-Embeddings построена на базе языковой модели GigaChat-3b и опубликована организацией ai-sage. У неё другой формат: инструкцию добавляют только к запросу, документы передаются как есть.
query = "Instruct: Найди документ, который отвечает на вопрос\nQuery: " + question
resp = client.embeddings.create(model="giga-embeddings", input=[query] + docs)
Окно у Giga-Embeddings — 4096 токенов, так что в индекс можно класть фрагменты длиннее. Обе модели распространяются под лицензией MIT.
Частые ошибки
Смешали векторы разных моделей. Векторы разных моделей эмбеддингов несовместимы: у них разная длина и разное пространство. Смена модели означает переиндексацию базы, а колонку в векторной БД нужно заводить под конкретный размер из таблицы выше.
403 «Модель недоступна для этого API-ключа». У ключа задан список разрешённых моделей, и нужной модели в нём нет. Откройте ключ в кабинете и добавьте её в поле «Разрешённые модели». Пустое поле — разрешены все модели. Если хотите, чтобы ключ работал только с моделями на серверах в России, перечислите в этом поле только их.
Эмбеддинг-модель вызвали через /v1/chat/completions. Для эмбеддингов нужен /v1/embeddings.
Итог
Если важно, чтобы текст запроса не уходил за рубеж, выбирайте модели с отметкой «Только серверы в РФ». Сейчас это три чат-модели — qwen3.6-35b, qwen3.8-27b и moonshotai/kimi-k2.6 — и четыре модели эмбеддингов, включая российские FRIDA и Giga-Embeddings. Вызываются они тем же ключом и тем же SDK, что и остальной каталог.
Формат запросов к эмбеддингам описан в документации. Если вы собираете RAG, пригодится материал про LangChain в России. Компании могут работать по договору.
Модели на серверах в России
Qwen, Kimi и эмбеддинги для русского языка через один ключ. Оплата в рублях.
Получить ключ →


