← Назад к ленте Открыть источник ↗

Сэкономить на токенах в 10 раз

Сэкономить на токенах в 10 раз

В наивной реализации нейросеть читает чат каждый раз заново и прогоняет через видеокарту всю историю диалога – хотя от запроса к запросу старые реплики не менялись. Для оптимизации провайдеры придумали кэширование – оно позволяет посчитать этот кусок однажды и дальше подставлять готовым. У Anthropic, например, чтение из кэша стоит раз в десять дешевле обычного, плюс ответ приходит быстрее.

К сожалению, лекарство неполное. Кэш живёт в памяти видеокарты, а её мало и она дорогая, поэтому под нагрузкой старые куски вытесняются и всё опять считается заново. Есть и привязка ко времени – отошёл человек от чата на час, вернулся, а контекст уже протух. В итоге глобально проблема никуда не делась – её просто немного сгладили.

Идея #стартапдня Tensormesh – не выбрасывать посчитанное, когда в видеопамяти кончается место, а сгружать кэш ниже: в обычную оперативную память, на SSD, в сетевое хранилище. Заодно он становится общим для всех видеокарт разом. Готовый кусок тогда переживает и вытеснение, и паузу, и переезд на другой сервер, а пересчитывать приходится заметно реже.

Движок можно скачать и использовать бесплатно. Он относительно популярен, на Github у проекта 9 600 звезд. У Nginx для сравнения 31 000, у OpenClaw 380 000. Зарабатывает Tensormesh на собственном хостинге чужих opensource моделей. Его формула – “кэшированные токены отдаем бесплатно”. Утверждается, что в каких-то сценариях это выйдет и в 10 раз дешевле обычной цены.

https://www.tensormesh.ai/

#ai #технология #rounda #сша

Ещё из канала

Все посты канала
О смысле жизни 1 день назад Расписание мероприятий ShareAI на сентябрь. 1 день назад О связи поколений 1 день назад Зумеры изобрели Abibas 2 дня назад О мудрости толпы 2 дня назад AI и человек 3 дня назад

Ещё по теме

В репозитории Codex на GitHub заметили новый возможный режим рассуждений — Persistent. vibecoding tg Дико интересно наблюдать за тем, как DHH делает свой дистрибутив линукса omarchy. Быстрый, красивый, opinionated (tiling wm + hyper app shortcuts). ctodaily Приятное небольшое улучшение Ollama: vibecoding tg 🛴 На самокатах Whoosh стали меньше кататься. Почему? Theedinorogblog 🥇Александр Миленькин, основатель проекта Prezka.ai, который завоевал «Продукт недели #1» в 143 наборе. Product Radar — лучшие стартапы России У кого-то в Codex начал появляться режим Luna Reserve. Когда лимит на продвинутые модели заканчивается, можно продолжить работу на GPT Luna как на запасном vibecoding tg

Совет: в ленте включайте только непрочитанное — так вы не смешиваете уже просмотренное с новыми постами.

Общение и предложения