Skip to main content
Palatine LLM API предоставляет OpenAI-совместимый интерфейс для работы с большими языковыми моделями. Вы можете использовать стандартный OpenAI SDK или любой HTTP-клиент для отправки запросов.
1

Авторизация

Получите API-токен в личном кабинете Palatine Speech
2

Выбор модели

GET /models — получите список доступных моделей
3

Отправка запроса

POST /chat/completions — отправьте сообщения и получите ответ
Параметр thinking включает расширенный режим рассуждений для сложных задач. Модель потратит больше времени на анализ, но выдаст более качественный результат.

Использование через OpenAI SDK

Самый простой способ интеграции — использовать официальный OpenAI Python SDK, указав базовый URL Palatine API.

Структурированный вывод (Pydantic)

Для получения ответа в виде структурированного объекта используйте response_format с JSON Schema или Pydantic-моделью.

Подробное описание API

Все запросы требуют авторизации через токен в заголовке: Authorization: Bearer <ваш_токен>
Запросите список доступных LLM моделей.
Пример ответа:
Этот эндпоинт не тарифицируется — можно вызывать без списания токенов.
Отправьте историю диалога и получите ответ от модели.
Пример ответа:
Для получения ответа в формате JSON используйте параметр response_format.
Для более строгого контроля над схемой JSON используйте response_format с типом json_schema и указанием JSON Schema.
Включите параметр thinking для сложных задач, требующих глубокого анализа.
Режим thinking увеличивает время ответа и расход токенов, но повышает качество для задач с логическими рассуждениями.
Роли сообщений:
Пример ответа с ошибкой:

Тарификация

Входящие и исходящие токены тарифицируются отдельно:
  • Входящие токены (prompt_tokens) — токены в вашем запросе (системный промпт + история диалога + текущее сообщение)
  • Исходящие токены (completion_tokens) — токены в ответе модели
Информация о расходе токенов возвращается в поле usage каждого ответа.
Эндпоинт GET /models не тарифицируется.