
Как снизить расходы на LLM: пять множителей в счёте
Счёт за нейросеть можно уменьшить в разы, не меняя модель. Мы прогнали 400 запросов и посчитали, сколько стоит каждая настройка: провайдер, класс обслуживания, кэш, длина контекста. На боте с двумя сотнями обращений в день разница вышла в 439 раз.



