← Все проекты
Живое демо · AI Infra

9router Compressor

LLM-прокси с роутингом моделей и сжатием промптов — меньше токенов, ниже счёт.

Показать технологии
PythonFastAPILLMllmlinguaWeb UI
Задача

Компании, активно использующие LLM, переплачивают за токены и завязаны на одного провайдера. Нужен слой, который удешевляет запросы и даёт гибкость в выборе моделей.

Решение и результат

Единый OpenAI-совместимый эндпоинт: приложение не переписывают, а 9router сам маршрутизирует запрос на подходящую модель и сжимает промпт перед отправкой. Меньше токенов на входе → ниже счёт за LLM, плюс можно гонять дешёвые модели там, где не нужна топовая.

Возможности

Что внутри

Мульти-модельный роутинг

Один /v1 раскидывает запросы по разным апстримам и моделям по правилам.

6 движков сжатия

Сжатие промптов, включая llmlingua — меньше токенов без потери смысла.

Веб-панель

Маршруты, модели и ключи меняются через UI на лету, без перезапуска.

Потоковая отдача

Прозрачный стриминг ответов апстрима клиенту.

OpenAI-совместимость

Drop-in замена: меняется только base_url.

Экономия бюджета

Сжатие + роутинг на дешёвые модели = прямая экономия.

Как это работает
Client /v1
Router
Compressor
Upstream LLM

Запрос → выбор маршрута → сжатие промпта → апстрим (OpenAI / OpenRouter / локальная модель) → потоковый ответ клиенту.

Нужно что-то похожее?

Опишите задачу — отвечу быстро и сделаю рабочее демо до оплаты.

Написать в Telegram →