·5 мин. чтения

Модели на серверах в России: данные не покидают РФ

Какие модели PlusVibe API работают на серверах в России: Qwen, Kimi, эмбеддинги FRIDA и Giga-Embeddings. Как их найти в каталоге, цены и пример запроса.

Модели на серверах в России: данные не покидают РФ

Большинство моделей в каталоге PlusVibe работают у поставщиков за рубежом. Для многих задач это не проблема, но для части компаний важно, где физически обрабатывается текст запроса. Поэтому в сентябре 2026 года мы добавили модели, которые запускаются на серверах в России: три чат-модели и несколько моделей эмбеддингов.

Ниже — что именно работает в России, как найти эти модели в каталоге и как их вызвать.

Зачем это нужно

Правила обработки данных в PlusVibe описаны на странице «152-ФЗ и данные» и в политике обработки персональных данных. Если коротко:

  • ваши собственные данные как клиента — почта, имя или наименование, ИНН, платёжные и технические данные — хранятся и обрабатываются на серверах в России;
  • содержимое запросов — промпты и аудио для транскрибации — передаётся поставщикам моделей, в том числе на вычислительные ресурсы за пределами России: в США, Китай и страны Евросоюза;
  • содержимое запросов не используется для обучения моделей.

Модели из этой статьи закрывают второй пункт: в нашем каталоге они отмечены как работающие на серверах в России, так что текст запроса к ним не уходит за рубеж. Это полезно, когда в промптах бывают данные клиентов, внутренние документы или переписка, которую вы не хотите отправлять за границу. Подробные правила трансграничной передачи и отзыва согласия — в согласии на обработку данных.

Какие модели работают в России

Чат-модели

Модель id в API Разработчик Qwen3.6 35B qwen3.6-35b Alibaba (Qwen) Qwen3.8 27B qwen3.8-27b Alibaba (Qwen) Kimi K2.6 moonshotai/kimi-k2.6 Moonshot

У каждой из трёх моделей все варианты в каталоге работают в России. Поэтому достаточно указать обычный идентификатор, никакой специальный суффикс не нужен. Размер контекста и возможности модели смотрите на её странице — ссылки в таблице.

Эмбеддинги

id в API Размер вектора Максимум на вход frida 1536 512 токенов giga-embeddings 2048 4096 токенов jina-embeddings-v4 2048 32 768 токенов qwen3-embedding-4b 2560 32 768 токенов

Размер вектора каждой модели мы проверили живым вызовом перед публикацией.

Как найти их в каталоге

На странице /models включите фильтр «Только серверы в РФ». Он работает и на вкладке чат-моделей, и на вкладке «Эмбеддинги». Фильтр строгий: показываются только модели, размещение которых в России подтверждено. Если у модели такой отметки нет, это не значит, что она работает за рубежом — просто у нас нет подтверждённых данных.

Через API тот же список отдаёт GET /v1/model-capabilities?stores_data_in_russia=true (нужен ваш ключ). У каждой модели в ответе есть поле stores_data_in_russia.

Цены

Чат-модели, за 1 млн токенов:

МодельВходВыход
qwen3.6-35b9 ₽/1M51 ₽/1M
qwen3.8-27b31 ₽/1M153 ₽/1M
kimi-k2.6125 ₽/1M525 ₽/1M

Эмбеддинги — оплачивается только входящий текст:

МодельВходВыход
frida4 ₽/1M0 ₽/1M
giga-embeddings7 ₽/1M0 ₽/1M
jina-embeddings-v47 ₽/1M0 ₽/1M
qwen3-embedding-4b7 ₽/1M0 ₽/1M

Цены подставляются из каталога в момент открытия страницы.

Пример запроса: чат-модель

Нужен ключ PlusVibe вида sk-pv-… — его можно создать после регистрации. Подойдёт любой OpenAI-совместимый клиент:

curl https://plusvibeapi.ru/v1/chat/completions \
  -H "Authorization: Bearer $PLUSVIBE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6-35b",
    "messages": [{"role": "user", "content": "Ответь одним словом: столица России?"}],
    "max_tokens": 300
  }'

Тот же запрос на Python:

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://plusvibeapi.ru/v1",
    api_key=os.environ["PLUSVIBE_API_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3.6-35b",
    messages=[{"role": "user", "content": "Ответь одним словом: столица России?"}],
    max_tokens=300,
)
print(resp.choices[0].message.content)

Перед публикацией мы отправили этот запрос во все три чат-модели. Каждая ответила «Москва».

Пример запроса: эмбеддинги

docs = [
    "Возврат товара возможен в течение 14 дней при сохранении чека.",
    "Доставка по Москве занимает один-два рабочих дня.",
]
query = "Сколько дней есть на возврат покупки?"

resp = client.embeddings.create(
    model="frida",
    input=["search_query: " + query] + ["search_document: " + d for d in docs],
)
vectors = [item.embedding for item in resp.data]
print(len(vectors[0]))  # 1536

В этом примере документ про возврат оказался ближе к вопросу, чем документ про доставку, — так и должно быть.

FRIDA и Giga-Embeddings: две модели российской разработки

Среди моделей эмбеддингов на российских серверах две сделаны в России.

FRIDA опубликована в организации ai-forever на Hugging Face, подробный разбор авторы выпустили в блоге SberDevices на Хабре. Модель построена на энкодере FRED-T5 и рассчитана на русский язык. Она ждёт префикс в начале каждого текста: search_query: перед вопросом и search_document: перед фрагментами базы знаний, как в примере выше. Для других задач есть paraphrase: и префиксы вида categorize…: . Окно — 512 токенов, поэтому длинные документы нужно нарезать мелкими кусками.

Giga-Embeddings построена на базе языковой модели GigaChat-3b и опубликована организацией ai-sage. У неё другой формат: инструкцию добавляют только к запросу, документы передаются как есть.

query = "Instruct: Найди документ, который отвечает на вопрос\nQuery: " + question
resp = client.embeddings.create(model="giga-embeddings", input=[query] + docs)

Окно у Giga-Embeddings — 4096 токенов, так что в индекс можно класть фрагменты длиннее. Обе модели распространяются под лицензией MIT.

Частые ошибки

Смешали векторы разных моделей. Векторы разных моделей эмбеддингов несовместимы: у них разная длина и разное пространство. Смена модели означает переиндексацию базы, а колонку в векторной БД нужно заводить под конкретный размер из таблицы выше.

403 «Модель недоступна для этого API-ключа». У ключа задан список разрешённых моделей, и нужной модели в нём нет. Откройте ключ в кабинете и добавьте её в поле «Разрешённые модели». Пустое поле — разрешены все модели. Если хотите, чтобы ключ работал только с моделями на серверах в России, перечислите в этом поле только их.

Эмбеддинг-модель вызвали через /v1/chat/completions. Для эмбеддингов нужен /v1/embeddings.

Итог

Если важно, чтобы текст запроса не уходил за рубеж, выбирайте модели с отметкой «Только серверы в РФ». Сейчас это три чат-модели — qwen3.6-35b, qwen3.8-27b и moonshotai/kimi-k2.6 — и четыре модели эмбеддингов, включая российские FRIDA и Giga-Embeddings. Вызываются они тем же ключом и тем же SDK, что и остальной каталог.

Формат запросов к эмбеддингам описан в документации. Если вы собираете RAG, пригодится материал про LangChain в России. Компании могут работать по договору.

Модели на серверах в России

Qwen, Kimi и эмбеддинги для русского языка через один ключ. Оплата в рублях.

Получить ключ →
модели на серверах в РоссииLLM в Россиироссийский хостинг нейросетей152-ФЗ нейросетиданные не покидают РФэмбеддинги в РоссииFRIDAGiga-Embeddings

Попробуйте PlusVibe API

OpenAI-совместимый API: GPT, Claude, Gemini, видео и изображения — один рублёвый ключ. Работает из России без VPN, оплата рублями.

Читайте также

Модели на серверах в России: данные не покидают РФ