Alexander Gorny · 2025-11-19 · source ↗ · whole document (5)
Сэкономить на токенах
Сэкономить на токенах
В мире сейчас доступны десятки LLM-моделей достаточно высокого качества. При этом для многих запросов все они выдают практически одинаковый ответ, но цена их и на порядок отличаться может. Разработчики используют более качественные продукты ради одного случая из ста, когда качество действительно может понадобиться, а платят зря все остальные 99 случаев.
Российский #стартапдня LeanLLM сэкономит часть этих денег. По замыслу основателей их продукт ставится как прослойка между программным кодом и нейросетями. При появлении запроса он смотрит на его “сложность” и “специальность” и отправляет в самого подходящего по соотношению цена-качество провайдера. В простых вопросах – в дешевого, в сложных – в качественного, в медицинских – в того, который про медицину лучше отвечает, условно говоря.
Второй используемый способ экономии – замена встроенных размышлений нейронок. LeanLLM применяет дешевые LLM для построения плана запроса, дробит данные на кусочки и отправляет в дорогую сеть уменьшенный контекст. Обычно без потери качества финального ответа. Всегда с экономией денег.