Perplexity Sonar API в России: как подключить LLM с поиском в интернете
У языковых моделей есть системная слабость: срез знаний. Всё, что случилось после даты обучения, модель не знает — и либо молчит, либо уверенно додумывает. Для задач, где важны свежие факты — новости, курсы валют, цены конкурентов, свежие версии библиотек, изменения законодательства — обычный чат-бот приходится обвешивать собственным поисковым конвейером: искать, выкачивать страницы, кроить контекст, и только потом спрашивать модель. Perplexity Sonar убирает этот конвейер внутрь модели: это семейство LLM, которые сами ищут в интернете и отвечают со ссылками на источники.
В статье разбираем: чем Sonar отличается от обычной чат-модели и где он, наоборот, лишний; какие три модели линейки доступны в нашем каталоге и какую для чего брать; как вызывать их через эндпоинт https://plusvibeapi.ru/v1 и доставать список источников из ответа; сколько это стоит на реальном объёме. Все цены взяты из живого каталога и актуальны на 4 сентября 2026 года.
Чем Sonar отличается от обычной чат-модели
Механика такая: модель получает вопрос, сама формулирует поисковые запросы, читает найденные страницы и собирает ответ по свежим данным, а не по параметрам, замороженным на дату обучения. В каталоге это отражено честно: срез знаний у всех трёх моделей линейки — «онлайн», а не какая-то дата.
Что это даёт разработчику:
- Живой веб-поиск. Не нужно строить собственный RAG поверх поисковика: запрос, выдача и отбор источников происходят на стороне модели. Вы отправляете один обычный чат-запрос и получаете готовый ответ по актуальным данным.
- Цитаты в ответе. Вместе с текстом возвращается поле
citations— массив ссылок на источники, по которым построен ответ. Их можно показать пользователю, проверить или использовать как вход для собственной проверки фактов. Это главное отличие от «просто спросить модель»: у каждого утверждения есть проверяемый след. - Свежесть вместо среза знаний. События вчерашнего дня, новые релизы, текущие котировки и цены — то, на чём обычные модели стабильно ошибаются, для Sonar штатный режим.
- OpenAI-совместимый формат. Запрос выглядит как обычный чат-комплит: те же поля, тот же SDK. Если ваш код уже работает с OpenAI-форматом, подключение сводится к замене
base_urlи ключа.
Честно про пределы — Sonar нужен не всегда:
- Поиск стоит денег и времени. Каждый запрос включает поисковый этап, поэтому ответ приходит медленнее, чем от обычной модели, а токены стоят дороже. Для генерации кода, перевода, художественного текста или классификации, где свежие факты не нужны, обычная модель даст тот же результат дешевле и быстрее — например, линейка DeepSeek, разбор подключения которой есть в нашей статье про DeepSeek API.
- Нет инструментов и строгого JSON. По каталогу у всех трёх моделей Sonar не заявлены вызов инструментов (tool calling) и JSON-режим. В агентные цепочки, где модель должна вызывать функции, и в пайплайны, ожидающие машинно читаемый ответ, они встраиваются хуже, чем обычные чат-модели.
- Ответ ограничен 8 000 токенов. Длинный аналитический отчёт целиком в один ответ не поместится — разбивайте на части или берите модель с большим лимитом ответа из общего каталога.
- Качество зависит от веба. Модель отвечает по найденным страницам: если источник в выдаче слабый, это отражается на ответе. Поэтому цитаты стоит не просто показывать, но и учитывать в продуктовой логике — например, просить пользователя или проверяющего агента опираться на ссылки.
Проще всего так: вопрос начинается со слов «что сейчас», «сколько стоит сегодня», «что изменилось» — это задача для Sonar. Вопрос про ваш собственный код или документ — это задача для обычной модели с вашим контекстом. Общий чеклист выбора между моделями и агрегаторами — в нашем разборе, как выбрать LLM API.
Три модели линейки: какую для чего брать
Цены ниже сверены с живым каталогом на 4 сентября 2026 года — актуальный прайс всегда виден на странице Модели и цены — и указаны в рублях за 1 000 000 токенов для варианта по умолчанию:
МодельID для запросовВход, ₽/1MВыход, ₽/1MКонтекстМакс. ответОсобенность Sonarsonar104,53104,53128 0008 000Быстрая и дешёвая: поиск в реальном времени
Sonar Prosonar-pro313,601 568200 0008 000Расширенный поиск и самое глубокое качество
Sonar Reasoning Prosonar-reasoning-pro209,44835,52128 0008 000Поиск плюс режим рассуждений (thinking)
Все три модели принимают текст, возвращают текст с цитатами и работают через один и тот же эндпоинт. Выбор между ними прямой:
sonar— рабочая лошадка для потока. Вход и выход стоят одинаково — 104,53 ₽ за миллион, это самая дешёвая модель линейки. Сюда относятся массовые сценарии: сводки новостей, мониторинг цен и упоминаний, ответы поддержки по свежим данным, короткие факт-запросы. Когда запросов много, а глубина исследования не нужна, — начинайте с неё. Страница модели — Sonar в каталоге.sonar-pro— для качества и больших документов. Расширенный поиск и окно контекста 200 000 токенов — самое большое в линейке: влезает длинное досье документов, к которому модель добавляет свежие данные из сети. Выход заметно дороже входа (1 568 ₽ против 313,60 ₽ за миллион), поэтому Pro оправдан там, где важен именно основательный ответ: аналитические отчёты, сравнение предложений, исследование рынка. Страница модели — Sonar Pro в каталоге.sonar-reasoning-pro— когда нужно не только найти, но и подумать. Это Sonar с режимом рассуждений: модель сначала разбирает вопрос по шагам и только потом отвечает. Подходит для многошаговых вопросов, сравнений и выводов по свежим данным. Две вещи для бюджета: токены рассуждений тарифицируются как выходные, а сам выход стоит 835,52 ₽ за миллион — закладывайте запас, если вопросы сложные. Страница модели — Sonar Reasoning Pro в каталоге.
Практическое правило: ставьте sonar по умолчанию, поднимайтесь до sonar-reasoning-pro, если ответ требует выводов по найденному, и до sonar-pro, если нужен самый глубокий поиск или большой контекст. Цена за запрос между соседними ступенями отличается в разы — это заметно на объёме.
Сколько это стоит на практике
Возьмём реалистичный сценарий — дайджест-бот, который по запросу пользователя собирает сводку по теме из свежих источников: 10 000 запросов в месяц, в среднем 2 000 входных токенов (вопрос, системный промпт и уточнения) и 600 выходных (ответ с цитатами). Это 20 млн входных и 6 млн выходных токенов в месяц:
- Sonar: 20 × 104,53 + 6 × 104,53 = 2 090,6 + 627,2 = около 2 718 ₽ в месяц.
- Sonar Reasoning Pro: 20 × 209,44 + 6 × 835,52 = 4 188,8 + 5 013,1 = около 9 202 ₽ в месяц. И это без учёта роста выхода из-за рассуждений: токены режима thinking тарифицируются как выходные, так что на сложных вопросах сумма будет выше.
- Sonar Pro: 20 × 313,6 + 6 × 1 568 = 6 272 + 9 408 = 15 680 ₽ в месяц.
Разброс между ступенями — почти шестикратный, поэтому выбор модели стоит делать по задаче, а не «с запасом». Второй рычаг — длина ответа: у всех трёх моделей линейки выходные токены дороже входных (у sonar-pro — в 5 раз), так что компактный ответ со ссылками экономит больше, чем у обычной чат-модели.
Подключение через PlusVibe API за 5 минут
Официальный API Perplexity оплачивается в долларах зарубежной картой и не даёт закрывающих документов для российской бухгалтерии — российские карты, включая «Мир», не принимаются. Рабочий путь для команды — российский агрегатор: PlusVibe API держит доступ к моделям на своей инфраструктуре и отдаёт их через единый OpenAI-совместимый эндпоинт с оплатой в рублях.
Получите ключ вида sk-pv-… в личном кабинете и отправляйте запросы на https://plusvibeapi.ru/v1. Реальные идентификаторы моделей: sonar, sonar-pro и sonar-reasoning-pro — ровно те, что возвращает эндпоинт /v1/models. Формат запросов и ответов — стандартный OpenAI; если вы никогда с ним не работали, начните с нашего руководства по OpenAI API для России.
curl
curl https://plusvibeapi.ru/v1/chat/completions \\
-H "Authorization: Bearer sk-pv-ВАШ_КЛЮЧ" \\
-H "Content-Type: application/json" \\
-d '{
"model": "sonar-pro",
"messages": [
{"role": "user", "content": "Какие версии Python вышли за последний месяц и что в них нового?"}
],
"max_tokens": 1024
}'
В ответе, помимо стандартных полей чат-комплита, придёт массив источников (фрагменты сокращены):
{
"id": "chatcmpl-...",
"choices": [
{
"message": {
"role": "assistant",
"content": "За последний месяц вышли исправительные релизы веток 3.13 и 3.12..."
},
"finish_reason": "stop"
}
],
"usage": { "prompt_tokens": 312, "completion_tokens": 260 },
"citations": [
"https://www.python.org/downloads/",
"https://peps.python.org/",
"https://docs.python.org/3/whatsnew/"
]
}
Python (openai SDK)
from openai import OpenAI
client = OpenAI(
base_url="https://plusvibeapi.ru/v1",
api_key="sk-pv-ВАШ_КЛЮЧ",
)
resp = client.chat.completions.create(
model="sonar-pro",
messages=[
{"role": "user", "content": "Собери сводку главных новостей про LLM за сегодня."},
],
max_tokens=1024,
)
print(resp.choices[0].message.content)
# Источники, по которым модель построила ответ, —
# массив ссылок в поле citations ответа.
sources = getattr(resp, "citations", None) or []
for url in sources:
print(url)
Поле citations — это плоский массив URL на верхнем уровне ответа, рядом с choices и usage; если ваш SDK-клиент прячет нестандартные поля, читайте его из сырого JSON — структура ответа показана в примере выше. Список источников может быть пустым, если модель ответила без обращения к сети, — это нормальный случай для вопросов, не требующих свежих данных. Потоковые ответы тоже работают штатно: достаточно передать stream: true, токены приходят по мере генерации.
Оплата и документы для юрлиц
- Рубли. Баланс пополняется российскими картами и через СБП — без валютных счетов и зарубежных карт.
- Счета и закрывающие документы. Работаем с юрлицами и ИП: счета, закрывающие документы по фактически потреблённым услугам за месяц направляем через ЭДО. Мы — ИП на УСН, поэтому в документах указывается «Без НДС».
- Постоплата. Для организаций возможна договорная отсрочка платежа по фактическому потреблению API — соглашение по ст. 823 ГК РФ. Начинаем с предоплаты, первый лимит — до 5 000 ₽ (карточка организации, наша проверка по открытым реестрам, подписанное соглашение; срок оплаты — 14 календарных дней). После двух вовремя оплаченных периодов лимит растёт до 10 000 ₽, дальше — индивидуальные условия. Постоплата предоставляется не всем: решение принимается по итогам проверки организации. Условия — на странице постоплаты для юрлиц.
Чего у нас нет — честно
- Нет вызова инструментов и строгого JSON-режима у моделей Sonar: по каталогу линейка отвечает свободным текстом с цитатами. Для агентных цепочек с функциями возьмите обычную чат-модель из каталога.
- Нет ответов длиннее 8 000 токенов — лимит общий для всех трёх моделей.
- Нет бесплатного тарифа на Sonar: поиск на стороне модели стоит денег, поэтому линейка работает только по обычному балансу.
- Нет прямого аккаунта на платформе Perplexity — вы работаете через наш эндпоинт и наш ключ; биллинг, поддержка и документы на нашей стороне.
Итог
Perplexity Sonar — самый короткий путь к ответам, подкреплённым живым интернетом: один обычный чат-запрос на https://plusvibeapi.ru/v1, и в ответе — текст с массивом источников в поле citations. Базовый sonar стоит 104,53 ₽ за миллион токенов и закрывает массовые задачи, sonar-reasoning-pro добавляет рассуждения для сложных вопросов, а sonar-pro с контекстом 200 000 токенов — самый глубокий поиск линейки. Через PlusVibe API всё это доступно из России без VPN: оплата в рублях, закрывающие документы через ЭДО, постоплата для юрлиц.
Зарегистрируйтесь бесплатно и сделайте первый запрос к Sonar за 5 минут.



