Песочница для AI куличиков
Так, хочу закрепить для всех ребят кто обсуждает это по разным чатикам =)
Нынче в популярных сообществах РФ все чаще обсуждают песочницы для агентов
Все пилят свои Cowork.
Все пилят свои OpenClaw в облаке
И все хотят при случае иметь мультитенанте
Но мало кто задумывается, сколько стоит такой мультитенант на проде и в эксплуатации и что же такое реально ИЗОЛЯЦИЯ а не просто умные слова
Залил подробный разбор этой статьи что мне прислали еще в начале года дабы освежить память https://www.luiscardoso.dev/blog/sandboxes-for-ai когда я наткнулся на очень толковый разбор темы, которую большинство понимает неправильно «A field guide to sandboxes for AI» (Luis Cardoso) читается ровно как то, что мы прошли руками, когда сажали Coder внутрь NeuralDeep-хаба(временно депрекейтнул из за стоимости инфры👍 )
Там я кратко описал, как его фреймворк ложится на наш реальный прод и заодно зачем нам bare metal в ЯД облаке.....Подробнее читать тут на моем сайте
А вы начем строите изолированные среды? Просто докер? Или все же VM по типу Firecracker MicroVM?
сейф шер репост
Так, хочу закрепить для всех ребят кто обсуждает это по разным чатикам =)
Нынче в популярных сообществах РФ все чаще обсуждают песочницы для агентов
Все пилят свои Cowork.
Все пилят свои OpenClaw в облаке
И все хотят при случае иметь мультитенанте
Но мало кто задумывается, сколько стоит такой мультитенант на проде и в эксплуатации и что же такое реально ИЗОЛЯЦИЯ а не просто умные слова
Залил подробный разбор этой статьи что мне прислали еще в начале года дабы освежить память https://www.luiscardoso.dev/blog/sandboxes-for-ai когда я наткнулся на очень толковый разбор темы, которую большинство понимает неправильно «A field guide to sandboxes for AI» (Luis Cardoso) читается ровно как то, что мы прошли руками, когда сажали Coder внутрь NeuralDeep-хаба(временно депрекейтнул из за стоимости инфры
Там я кратко описал, как его фреймворк ложится на наш реальный прод и заодно зачем нам bare metal в ЯД облаке.....Подробнее читать тут на моем сайте
А вы начем строите изолированные среды? Просто докер? Или все же VM по типу Firecracker MicroVM?
сейф шер репост
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍26🔥16❤10🤔1👀1
Agentic Web Search для Битрикс24
Как встроить свои идеи в продукт изнутри?
Ещё в начале года писал, что начал консультировать Битрикс24 (кто сидит в чатике точно видел) ну и вы видели у меня на гите пару сервисов к Битрикс
Дошли руки рассказать про один из проектов и про то как это выглядит внутри, и что же я там навоял =)
Три месяца назад всё началось с "Привет, не хочешь помочь с поиском?"
А на этой неделе мы запустили поиск в прод
За эти три месяца я хорошо узнал AI-команду Битрикс24 и там офигеть какие крутые ребята работают ❤️
Еще вышел BitrixGPT 5.5 Agent
Часть его веб агент (за него я по большей части и отвечал в этой связке) сделан по образу изолированного цикла от общего пайплайна агента, уже крутится в проде и доступен миллионам на порталах
Идея простая как пеплексити лайк системы только вот нужны реалии РФ, выпустили публичный API за три месяца внутри корпорации я сам, честно, не ожидал
Там отдельная история про AI SDLC/PDLC (можно подробнее скажите вы, точно раскрою в следующих сериях скажу я вам)
Что сложного спросите вы?
Взял cloude code + codex
Кинул промпт
Взяли ReAct + OAASDK
Дали прод сервер и погнали?
Это ровно то, с чего я стартовал, и работает оно отвратительно (а чаще просто неконтролируемо) так как вся система работает на внутренней модели
Голая связка выдаёт уверенный бред с цитатой из статьи десятилетней давности
Весь проект это обвязка вокруг этой наивной схемы
Три вещи, которые реально сдвинули качество
И не забываем что сервис должен выдержать 1000 RPS минимум и проектируем все с этим заделом
Grounding
Научили модель молчать, когда факта в выдаче нет, а не досочинять. Был показательный баг — агент выдумывал французские городки, которых не существует в природе. Температуру в пол, обязательная цитата [N] на каждый тезис, нечего процитировать — ответа нет
Плюс аккуратный подбор параметров запуска модели и работа с harness вокруг
Скучно, зато не врёт =)
Query expansion
"Че там по ставке?" для модели это мусор.
Агент сам разворачивает такой вопрос в 3–4 нормальных запроса к Яндексу: решение по ключевой ставке, последнее заседание ЦБ, прогнозы на 2026
Без этого шага точность падала почти вдвое это не ощущение, это замер до/после
Бенчи
Прогнали 3800+ тяжёлых вопросов: FreshQA, SimpleQA и свой внутренний хардкор по Рунету там, где англоязычные бенчи бесполезны
Вышло 93.7% (это на нашем внутреннем бенче по Рунету на нём мы и меряем реальную повестку)
На части сценариев это выше, чем показывает большинство решений
И еще несколько важных подсистем
Контроль цикла и выхода из него
Цитаты (и правильная постановка в стриминг)
Контроль кол-ва источников
Проверка источников
Вот так это работает и вроде все опять просто, агент дёргается по API прямо с портала Битрикс24 как отдельная сущность
Не надо поднимать свою инфру, индексы, воевать с галлюцинациями берёшь эндпоинт и получаешь штуку, которая шарит в текущей повестке и цитирует источники
И, что важно, адаптирована под текущую инфраструктуру
Уже живое, тыкайте на порталах раскатка идет, зашито в основной цикл агента только попросите поискать в интернете (или он это определит сам)
Затестите напишите, как вам точность на своих запросах
Фидбек приветствуется
Как встроить свои идеи в продукт изнутри?
Ещё в начале года писал, что начал консультировать Битрикс24 (кто сидит в чатике точно видел) ну и вы видели у меня на гите пару сервисов к Битрикс
Дошли руки рассказать про один из проектов и про то как это выглядит внутри, и что же я там навоял =)
Три месяца назад всё началось с "Привет, не хочешь помочь с поиском?"
А на этой неделе мы запустили поиск в прод
За эти три месяца я хорошо узнал AI-команду Битрикс24 и там офигеть какие крутые ребята работают ❤️
Еще вышел BitrixGPT 5.5 Agent
Часть его веб агент (за него я по большей части и отвечал в этой связке) сделан по образу изолированного цикла от общего пайплайна агента, уже крутится в проде и доступен миллионам на порталах
Идея простая как пеплексити лайк системы только вот нужны реалии РФ, выпустили публичный API за три месяца внутри корпорации я сам, честно, не ожидал
Там отдельная история про AI SDLC/PDLC (можно подробнее скажите вы, точно раскрою в следующих сериях скажу я вам)
Что сложного спросите вы?
Взял cloude code + codex
Кинул промпт
Взяли ReAct + OAASDK
Дали прод сервер и погнали?
Это ровно то, с чего я стартовал, и работает оно отвратительно (а чаще просто неконтролируемо) так как вся система работает на внутренней модели
Голая связка выдаёт уверенный бред с цитатой из статьи десятилетней давности
Весь проект это обвязка вокруг этой наивной схемы
Три вещи, которые реально сдвинули качество
И не забываем что сервис должен выдержать 1000 RPS минимум и проектируем все с этим заделом
Grounding
Научили модель молчать, когда факта в выдаче нет, а не досочинять. Был показательный баг — агент выдумывал французские городки, которых не существует в природе. Температуру в пол, обязательная цитата [N] на каждый тезис, нечего процитировать — ответа нет
Плюс аккуратный подбор параметров запуска модели и работа с harness вокруг
Скучно, зато не врёт =)
Query expansion
"Че там по ставке?" для модели это мусор.
Агент сам разворачивает такой вопрос в 3–4 нормальных запроса к Яндексу: решение по ключевой ставке, последнее заседание ЦБ, прогнозы на 2026
Без этого шага точность падала почти вдвое это не ощущение, это замер до/после
Бенчи
Прогнали 3800+ тяжёлых вопросов: FreshQA, SimpleQA и свой внутренний хардкор по Рунету там, где англоязычные бенчи бесполезны
Вышло 93.7% (это на нашем внутреннем бенче по Рунету на нём мы и меряем реальную повестку)
На части сценариев это выше, чем показывает большинство решений
И еще несколько важных подсистем
Контроль цикла и выхода из него
Цитаты (и правильная постановка в стриминг)
Контроль кол-ва источников
Проверка источников
Вот так это работает и вроде все опять просто, агент дёргается по API прямо с портала Битрикс24 как отдельная сущность
Не надо поднимать свою инфру, индексы, воевать с галлюцинациями берёшь эндпоинт и получаешь штуку, которая шарит в текущей повестке и цитирует источники
И, что важно, адаптирована под текущую инфраструктуру
Уже живое, тыкайте на порталах раскатка идет, зашито в основной цикл агента только попросите поискать в интернете (или он это определит сам)
Затестите напишите, как вам точность на своих запросах
Фидбек приветствуется
Telegram
Битрикс24 для бизнеса
А что у меня сегодня по сделкам? 👀
Расскажет новый AI-агент BitrixGPT! ⡐⠤⡅⢈⢃⠔ ⢑⡠⠖⠇⠢ ⢨⣠ ⡅⣐⠜⠨⢨ ⣠⠸⡒⡌⢡⡰⢌⠬ ⠩⢤⡉⣂⡂⢔⠔⢁⡉⣀
Новый AI-агент работает на последней версии BitrixGPT 5.5.
✅ В 4 раза лучше работает с длинным контекстом — меньше путается, больше понимает.…
Расскажет новый AI-агент BitrixGPT! ⡐⠤⡅⢈⢃⠔ ⢑⡠⠖⠇⠢ ⢨⣠ ⡅⣐⠜⠨⢨ ⣠⠸⡒⡌⢡⡰⢌⠬ ⠩⢤⡉⣂⡂⢔⠔⢁⡉⣀
Новый AI-агент работает на последней версии BitrixGPT 5.5.
✅ В 4 раза лучше работает с длинным контекстом — меньше путается, больше понимает.…
46🔥42❤24👍16🤡4💊4👌2🤣2
Для pro тарифа доступен теперь и квен fp8 только веса кеш фп16, для быстрых и выделенных задач
120 t/s single request
70t/ 10 parallel
neuraldeep.ru
120 t/s single request
70t/ 10 parallel
neuraldeep.ru
1🔥23👍5 4
Тест стримчанских от яндекс
Решил немного повайбкодить под windows свой проект copyosity
Залетай на обеденный вайбкод стрим
За одно потестим стримы от телемоста
Update: стрим закончился
Решил немного повайбкодить под windows свой проект copyosity
Залетай на обеденный вайбкод стрим
За одно потестим стримы от телемоста
Update: стрим закончился
telemost.360.yandex.ru
Яндекс Телемост — бесплатные видеовстречи без регистрации и ограничения по времени
Бесплатные видеоконференции и встречи прямо в браузере. Подключение без регистрации, удобно с ПК и телефона. Работайте, учитесь и общайтесь онлайн
1❤13🔥8😁5👏1🤮1 1
Вертикальный бар для Copyosity.
Это моя замена Paste и аналогам, за которые я платил по $200 в год. Кратко: это буфер обмена, который на Mac не реализован, но также есть куча других функций! Например, Voice mode или общение с агентом.
https://github.com/vakovalskii/copyosity
Voice mode для инпута через neuraldeep.ru
https://github.com/vakovalskii/copyosity/releases
Залетайте в релизы (качайте свою апку).
Для Windows подписи еще нет.
И спасибо @edwovld за толчок приложения в UI-апдейте и огромном кол-ве фичей!
Это моя замена Paste и аналогам, за которые я платил по $200 в год. Кратко: это буфер обмена, который на Mac не реализован, но также есть куча других функций! Например, Voice mode или общение с агентом.
https://github.com/vakovalskii/copyosity
Voice mode для инпута через neuraldeep.ru
https://github.com/vakovalskii/copyosity/releases
Залетайте в релизы (качайте свою апку).
Для Windows подписи еще нет.
И спасибо @edwovld за толчок приложения в UI-апдейте и огромном кол-ве фичей!
1🔥18❤12👍11🦄1
КТО прошел верификацию в AI Native
Срочно свой фреймворк в коменты и скрин что сделали его за 120 минут
Срочно свой фреймворк в коменты и скрин что сделали его за 120 минут
😁25🔥19🤯3❤1💯1
Forwarded from AiHub ✨ Приручаем ИИ | Вайб-кодинг | Ai-first development
Skill + cli для AI агентов по управлению вашим портфелем в сервисе т. инвестиции уже здесь.
↗️ Да-да, я не сошёл с ума. Теперь агент берет на себя всю рутину по анализу вашего портфеля и рынка ценных бумах и прочих активов. Нет, это не торговый бот, и НЕ КОНСУЛЬТАНТ, ведь закон гласит: нельзя кому попадя раздавать ИИР (индивидуальные инвестиционные рекомендации). Это терминал в прямом смысле слова для доступа к т.инвестициям. Инвестируем на вайбе!
Денег он за Вас не заработает, но даст исчерпывающую картину рынка инвестиций, проанализирует степень диверсификации, рассчитает доходность, напомнит про ближайшие дивиденды и купоны, соберет актуальные новости.
Skill содержит cli, который вмещает в себя полноценный клиент для работы с api. Без сторонних зависимостей. Упаковано в js файл.
Чтобы не пугать с порога: у агента есть 3 режима:
1️⃣ Sandbox.
Песочница, деньги на счету ненастоящие, а котировки и вся информация по api - актуальная, можно потренироваться на виртуальном балансе и оценить работу скилла и агента в целом.
2️⃣ Read-only.
Агент уже видит реальный баланс, но денежных операций выполнить не получится. В данном режиме агент перелопатит за вас тонну информации и даст полную картину по рынку, сэкономив время на скрининге.
3️⃣ Full
В этом режиме есть возможность уже покупать и продавать, со всеми трейдерскими опциями, и конечно же через жесткое подтверждение в агенте по каждой операции. При этом всём, агент перед каждой операцией хорошенько проверит, не "хомяк" ли вы.
🚨 Если вы почувствовали, что нейросети уже готовы, есть специальный режим (
Чуть-чуть погонял на реальном портфеле, буду дальше пользоваться на постоянке.
💻 Репозиторий
(проще дать его агенту он сам установит)
🗯
(установка командой)
🎆 Репосты и звезды в github приветствуются.
Денег он за Вас не заработает, но даст исчерпывающую картину рынка инвестиций, проанализирует степень диверсификации, рассчитает доходность, напомнит про ближайшие дивиденды и купоны, соберет актуальные новости.
Skill содержит cli, который вмещает в себя полноценный клиент для работы с api. Без сторонних зависимостей. Упаковано в js файл.
Чтобы не пугать с порога: у агента есть 3 режима:
Песочница, деньги на счету ненастоящие, а котировки и вся информация по api - актуальная, можно потренироваться на виртуальном балансе и оценить работу скилла и агента в целом.
Агент уже видит реальный баланс, но денежных операций выполнить не получится. В данном режиме агент перелопатит за вас тонну информации и даст полную картину по рынку, сэкономив время на скрининге.
В этом режиме есть возможность уже покупать и продавать, со всеми трейдерскими опциями, и конечно же через жесткое подтверждение в агенте по каждой операции. При этом всём, агент перед каждой операцией хорошенько проверит, не "хомяк" ли вы.
stonks mode, включается в .env файле, лежит по пути ~/.config/tinvest папка создастся при автоматической установке, либо создать вручную и положить туда). Дает агенту возможность делать операции без подтверждений. Но даже тут агент просто так не пойдет что-то делать, пока его не попросишь (ну или не повесишь на cron своему клешнеботу задачу что-то периодически выполнять, например, мониторить курсы или искать желаемую точку входа в актив)Чуть-чуть погонял на реальном портфеле, буду дальше пользоваться на постоянке.
💻 Репозиторий
(проще дать его агенту он сам установит)
🗯
curl -fsSL https://raw.githubusercontent.com/nyxandro/t-invest-skill/main/install.sh | bash(установка командой)
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥24😁16❤6
TermDeck "Cmd+Shift+T", только для терминала
Меня дико бесило одно и я запилил очередной опенсорс =)
Я давно пересел на Claude Code CLI (это терминальный агент). Работаю в iTerm2 на macOS.
Как удалёнку привык к RustDesk.
И до сих пор ничего не менял в statusline, который советовал не так давно.
Но что бесило во всём этом: стоило закрыть/обновить/разрядить ноут и приходилось точечно, вручную восстанавливать каждую сессию через кодбаш, который и так перегружен функциями
При этом мне нравилось, что я могу:
- дать свой нейминг каждой вкладке (даже если внутри сплит),
- держать рабочее окно ровно таким, как собрал.
Я хотел три вещи:
1. Автосохранение рабочего окна.
2. Одну кнопку «ВОССТАНОВИТЬ».
3. Чтобы после ребута всё поднялось само с теми же папками, сплитами и именами
4. То что не предлагает ни один врапер, управление хтттп прокси и их сторинг
+ Я решил собрать все же десктоп апп который будет прям отображать как вкладки "были"
Хотел как делает Chrome (или любой браузер) по Cmd+Shift+T возвращает закрытые вкладки предыдущей сессии
Только здесь для терминала с Claude Code
Что я таким способом решил? Для себя не боюсь потерять визуально свои терминалы и востановить все сессии, и самое важное что большинство комментаторов не заметит потому что не откроют репо это нативная работа с http прокси в обход ограничений АПИ антропика
РЕПО: https://github.com/vakovalskii/termdeck
DMG: https://github.com/vakovalskii/termdeck/releases/download/v1.0.0/TermDeck-1.0.0-arm64.dmg
Меня дико бесило одно и я запилил очередной опенсорс =)
Я давно пересел на Claude Code CLI (это терминальный агент). Работаю в iTerm2 на macOS.
Как удалёнку привык к RustDesk.
И до сих пор ничего не менял в statusline, который советовал не так давно.
Но что бесило во всём этом: стоило закрыть/обновить/разрядить ноут и приходилось точечно, вручную восстанавливать каждую сессию через кодбаш, который и так перегружен функциями
При этом мне нравилось, что я могу:
- дать свой нейминг каждой вкладке (даже если внутри сплит),
- держать рабочее окно ровно таким, как собрал.
Я хотел три вещи:
1. Автосохранение рабочего окна.
2. Одну кнопку «ВОССТАНОВИТЬ».
3. Чтобы после ребута всё поднялось само с теми же папками, сплитами и именами
4. То что не предлагает ни один врапер, управление хтттп прокси и их сторинг
+ Я решил собрать все же десктоп апп который будет прям отображать как вкладки "были"
Хотел как делает Chrome (или любой браузер) по Cmd+Shift+T возвращает закрытые вкладки предыдущей сессии
Только здесь для терминала с Claude Code
Что я таким способом решил? Для себя не боюсь потерять визуально свои терминалы и востановить все сессии, и самое важное что большинство комментаторов не заметит потому что не откроют репо это нативная работа с http прокси в обход ограничений АПИ антропика
РЕПО: https://github.com/vakovalskii/termdeck
DMG: https://github.com/vakovalskii/termdeck/releases/download/v1.0.0/TermDeck-1.0.0-arm64.dmg
💯20👍11🔥11❤7
Активно трогаю траву на природе и при этом вайблю хаб
Стрим будет завтра примерно в 19 часов
На хабе новая фишка PII Guardrails API для детекции и анонимизации контента https://neuraldeep.ru/docs#guardrails
Стрим будет завтра примерно в 19 часов
На хабе новая фишка PII Guardrails API для детекции и анонимизации контента https://neuraldeep.ru/docs#guardrails
👍20 17🔥13❤3👌1
Forwarded from Koda
🚀🚀🚀 Kodacode release v1.0 + топовая модель Koda Pro на основе GLM 5.2
Прошёл больше года с первого публичного релиза KodaCode для VS Code — и сегодня мы выпускаем версию 1.0. Да и с лендинга убираем подпись «beta-тестирование».
В v1.0 мы сильно обновили агента, улучшили модели.
На нашем бенче из задач SWE-bench Verified качество старой Koda Pro выросло на +10 п.п.:
Koda Pro old: 59% → 69%
Koda Base: 35% → 45.1%
А новая Koda Pro на GLM 5.2 приблизилась к топовым моделям:
Koda Pro GLM 5.2 — 77.4%
Claude Sonet 5 — 78.8%
Claude Opus 4.8 — 83%
Еще в релизе кроме агента :
- маркетплейс скилов и MCP
- простое подключение российских провайдеров моделей: vsellm.ru, bothub.chat, proxyapi.ru, neuraldeep.ru.
- Telegram-интеграцию теперь можно использовать не только в VS Code, но и в JetBrains и CLI
- добавили просмотр diff прямо в чате в плагинах
- улучшили с зависаниями на больших сессиях
- кучу багов пофиксили
Больше деталей в статье на хабре https://habr.com/ru/article/1056758/
Скачать KodaCode тут https://download.kodacode.ru
Прошёл больше года с первого публичного релиза KodaCode для VS Code — и сегодня мы выпускаем версию 1.0. Да и с лендинга убираем подпись «beta-тестирование».
В v1.0 мы сильно обновили агента, улучшили модели.
На нашем бенче из задач SWE-bench Verified качество старой Koda Pro выросло на +10 п.п.:
Koda Pro old: 59% → 69%
Koda Base: 35% → 45.1%
А новая Koda Pro на GLM 5.2 приблизилась к топовым моделям:
Koda Pro GLM 5.2 — 77.4%
Claude Sonet 5 — 78.8%
Claude Opus 4.8 — 83%
Еще в релизе кроме агента :
- маркетплейс скилов и MCP
- простое подключение российских провайдеров моделей: vsellm.ru, bothub.chat, proxyapi.ru, neuraldeep.ru.
- Telegram-интеграцию теперь можно использовать не только в VS Code, но и в JetBrains и CLI
- добавили просмотр diff прямо в чате в плагинах
- улучшили с зависаниями на больших сессиях
- кучу багов пофиксили
Больше деталей в статье на хабре https://habr.com/ru/article/1056758/
Скачать KodaCode тут https://download.kodacode.ru
10🔥31❤10👍7😁3 1
Валера Ковальский
Завтра, 30.06.2026 Запишем новый стрим по самой базе (по версии Валеры Ковальского) Изучим то, что именно все перепрыгивают когда открывают GUI для вайбкодинга Опустимся в самые недра терминалов и сборки ядра Linux (шучу). Приходите, будет интересно. Также…
Настроим рабочее место разработчика
Попробуем уложится в 1-2 часа
Ну что чутка раньше начнем
Раньше закончим!
https://telemost.360.yandex.ru/live/eec190763e54494891c33a2f092cd9e2
Попробуем уложится в 1-2 часа
Ну что чутка раньше начнем
Раньше закончим!
https://telemost.360.yandex.ru/live/eec190763e54494891c33a2f092cd9e2
telemost.360.yandex.ru
Яндекс Телемост — бесплатные видеовстречи без регистрации и ограничения по времени
Бесплатные видеоконференции и встречи прямо в браузере. Подключение без регистрации, удобно с ПК и телефона. Работайте, учитесь и общайтесь онлайн
❤15🔥11👍5🤡5
Валера Ковальский
Настроим рабочее место разработчика Попробуем уложится в 1-2 часа Ну что чутка раньше начнем Раньше закончим! https://telemost.360.yandex.ru/live/eec190763e54494891c33a2f092cd9e2
Всем спасибо за участие! Стрим завершился
Мы собрали более 350 зрителей на стартовом вводном стриме «Как настроить рабочее место разработчика по мнению Валеры Ковальского».
Пишите в комментариях, что бы вы хотели разобрать в следующих сериях.
Отберу лучшие запросы и разберем!
Что мы ставили и настраивали тут
Запись будет!
После вступления в группу для коментов не забывайте пройти капчу по ссылке https://t.iss.one/neuraldeepchat
Мы собрали более 350 зрителей на стартовом вводном стриме «Как настроить рабочее место разработчика по мнению Валеры Ковальского».
Пишите в комментариях, что бы вы хотели разобрать в следующих сериях.
Отберу лучшие запросы и разберем!
Что мы ставили и настраивали тут
Запись будет!
После вступления в группу для коментов не забывайте пройти капчу по ссылке https://t.iss.one/neuraldeepchat
👍49🔥32❤9
Forwarded from Илья Филиппов
2026_07_09_калькулятор_LLM_инференса_filippov_GenAI.xlsx
25.2 KB
Сколько на самом деле стоит 1M токенов на своём железе
Сделал калькулятор того, как стоимость своего GPU переходит в себестоимость токенов.
Оказалось, что достаточно нетривиальная задача, тк челленджит все знания об LLM: как работают слои, чем MoE отличается от dense, как устроен KV cache. В общем обновил по пути все свои знания GenAI. Понятно, что куча допущений внутри, а параметры собирал Fable, надо тестировать на реальных серверах, но это может быть отправной точкой.
Что по выводам?
• Строить или покупать — это вопрос утилизации, не технологии. Сможет ли сервис создать высоукую утилизацию сервера и есть ключевой вопрос.
• MoE — скидка на скорость, но не на память. Кол-во активных параметров 3 млрд из 35: карта пишет быстро, но веса лежат целиком. Отсюда контринтуитивный результат: большие MoE модели на дешёвых картах — экономически лучшая пара, пока хватает VRAM.
• ROI-ловушка. 390% годовых и выше работает при УЖЕ НАЙДЕННОМ спросе; поиск клиентов, SLA, биллинг в модели не учтены. Поэтому супер важно обеспечить потребление, а не накупить дорогих игрушек.
Скачивайте, подставляйте свои данные и посмотрите себестоимость. Найдете ошибки - дайте знать)
Илья Филиппов
Сделал калькулятор того, как стоимость своего GPU переходит в себестоимость токенов.
Оказалось, что достаточно нетривиальная задача, тк челленджит все знания об LLM: как работают слои, чем MoE отличается от dense, как устроен KV cache. В общем обновил по пути все свои знания GenAI. Понятно, что куча допущений внутри, а параметры собирал Fable, надо тестировать на реальных серверах, но это может быть отправной точкой.
Что по выводам?
• Строить или покупать — это вопрос утилизации, не технологии. Сможет ли сервис создать высоукую утилизацию сервера и есть ключевой вопрос.
• MoE — скидка на скорость, но не на память. Кол-во активных параметров 3 млрд из 35: карта пишет быстро, но веса лежат целиком. Отсюда контринтуитивный результат: большие MoE модели на дешёвых картах — экономически лучшая пара, пока хватает VRAM.
• ROI-ловушка. 390% годовых и выше работает при УЖЕ НАЙДЕННОМ спросе; поиск клиентов, SLA, биллинг в модели не учтены. Поэтому супер важно обеспечить потребление, а не накупить дорогих игрушек.
Скачивайте, подставляйте свои данные и посмотрите себестоимость. Найдете ошибки - дайте знать)
Илья Филиппов
🔥38👍12❤5👀5
Моему GitHub ровно год
101 репозитория
72 проекта
стеки от Python до Rust
Главное не цифры на сегодня, а то, что ИИ убрал барьер между "придумал" и "выложил в мир"
гипотеза
прототип
показал
120 минут =)
Не переставайте экспериментировать и показывать свои решения миру
Это ваша ценность сегодня, и то что будет сподвигать вас исследовать завтра!💀
101 репозитория
72 проекта
стеки от Python до Rust
Главное не цифры на сегодня, а то, что ИИ убрал барьер между "придумал" и "выложил в мир"
гипотеза
прототип
показал
120 минут =)
Не переставайте экспериментировать и показывать свои решения миру
Это ваша ценность сегодня, и то что будет сподвигать вас исследовать завтра!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥130❤28👍21🤣3🤡1 1
Запись стрима не абы какая, а самая ИИшная и всё на локальном железе!
Я решил взять 3 продукта с нашего хаба:
1) https://speechcore.neuraldeep.ru/ (ASR для больших видео с возможностью выгрузить субтитры через API)
2) https://hub.neuraldeep.ru/app/overview (API к LLM-моделям и к qwen3.6-fp8 для описания видео)
3) https://hub.neuraldeep.ru/app/overview (API к qwen3.6-fp16-noreasoning для очистки терминов)
И сделал интерфейс для просмотра и взаимодействия с таким вот анализом:
- Субтитры автоматически правильные
- Хайлайты
- Транскрипт
- Спросить у LLM по видео
Смотрим тут на хабе! https://neuraldeep.ru/learn/lessons/claude-code-setup
Я решил взять 3 продукта с нашего хаба:
1) https://speechcore.neuraldeep.ru/ (ASR для больших видео с возможностью выгрузить субтитры через API)
2) https://hub.neuraldeep.ru/app/overview (API к LLM-моделям и к qwen3.6-fp8 для описания видео)
3) https://hub.neuraldeep.ru/app/overview (API к qwen3.6-fp16-noreasoning для очистки терминов)
И сделал интерфейс для просмотра и взаимодействия с таким вот анализом:
- Субтитры автоматически правильные
- Хайлайты
- Транскрипт
- Спросить у LLM по видео
Смотрим тут на хабе! https://neuraldeep.ru/learn/lessons/claude-code-setup
🔥62👍11❤9👀4