Машинное обучение digest
54 subscribers
3.71K photos
596 videos
2.26K links
Download Telegram
🤯 Вышел GemOpus-4 26-A4B - локальный Opus на минималках

Новая модель от JackRong - это Gemma 4, но с reasoning в стиле Claude Opus.

Что внутри:

База: Gemma 4 26B MoE
Активных параметров всего 4B
Поверх - дистилляция логики Opus

По факту это попытка упаковать уровень рассуждений больших моделей в компактный локальный формат.

По перфу:

• ~75 токенов в секунду
• 22.7 GB VRAM
• Контекст до 131K

То есть модель реально можно крутить локально и получать нормальный reasoning, а не просто автодополнение.

Если связать с агентом типа HemresAgent - получается уже почти полноценный локальный AI-ассистент под задачи разработки и автоматизации.

Хороший вариант, если хочется мощный reasoning без облака и с контролем над всем стеком

https://huggingface.co/Jackrong/Gemopus-4-26B-A4B-it-GGUF
⚡️ Metro 4 слили в сеть — в Твиттере опубликовали билд якобы отменённой в 2022-м новой игры в серии Metro.

Главное об игре:
• Полностью открытый мир, ещё более открытый чем в Exodus
• Действие происходит в 2033-2034 годах
• Костюм химзащиты с возможностью апгрейда
• Можно было бухать, чтобы снизить воздействие радиации
• Был полноценный крафтинг
• В сюжете присутствовали Хантер, Хан и Бурбон.


Перезапущенную версию Metro 4 должны показать на следующей неделе — это будет уже совсем другая игра.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤖 Автономные AI-агенты для инженерии

AutoAgent позволяет AI-агентам самостоятельно настраивать и улучшать свои конфигурации, используя мета-агента. Пользователь задает задачи через program.md, а агент автоматически модифицирует свою архитектуру и оценивает результаты.

🚀 Основные моменты:
- Автоматическая настройка AI-агентов без прямого редактирования кода.
- Использует Markdown для задания задач и инструкций.
- Оценка производительности через числовые баллы.
- Поддержка Docker для изоляции выполнения.
- Совместимость с задачами Harbor.

📌 GitHub: https://github.com/kevinrgu/autoagent

#python
🚀 Исследование утечки кода Claude Code

Этот репозиторий содержит утекший исходный код Claude Code, CLI от Anthropic, который стал доступен через sourcemap в npm. Здесь вы найдете полное описание утечки и внутренние системы, которые не должны были стать публичными.

🚀 Основные моменты:
- Полный исходный код утечен через sourcemap в npm.
- Включает уникальную систему Tamagotchi для взаимодействия.
- Содержит механизмы защиты от утечки внутренней информации.
- Архитектура включает более 40 инструментов и сложную многопользовательскую оркестрацию.

📌 GitHub: https://github.com/yasasbanukaofficial/claude-code

#typescript
Git скоро всё? Сооснователь GitHub поднял $17 млн на нового Git-клиента 🤑

Скотт Чакон считает, что классический Git УСТАРЕЛ И плохо работает в мире, где код пишут не только люди, но и ИИ-агенты. Поэтому он создал пару лет назад GitButler и теперь выкатил CLI-версию.

Главная его идея — более удобный интерфейс и отсутствие классического переключения между ветками + параллельная работа. Вообще внутри много прикольных фич — сразу видно, что разрабатывал не новичок. А еще это бесплатно и опенсорс.

Пробуем 👌

@xor_journal
Please open Telegram to view this post
VIEW IN TELEGRAM
Прокачиваемся в вайбкодинге: Lovable запустили целый сайт с гайдами по созданию веб-приложений с помощью ИИ.

На сайте собраны шаблоны, советы по промтингу, готовые инструкции и видеолекции. Есть даже конструктор промтов — можно просто описать идею, а он задаст уточняющие вопросы и напишет рабочий промт.

Становимся профессиональными вайбкодерами по ссылке.
✔️ GPT-5.4 провалил бенчмарк METR, а без читерства и вовсе не догоняет Opus 4.6

GPT-5.4 снова провалил бенчмарк
Организация METR опубликовала результаты тестирования GPT-5.4 (xhigh) на задачах с оценкой временного горизонта, и цифры получились неоднозначные.

По стандартной методологии METR, где reward hacking (то есть ситуации, когда модель обманывает код оценки вместо реального решения задачи) считается провалом, GPT-5.4 показал time horizon всего 5.7 часов с 95% доверительным интервалом от 3 до 13.5 часов. Для сравнения, Claude Opus 4.6 от Anthropic держит планку в районе 12 часов. Разница ощутимая.

Но есть нюанс. Если засчитать те самые запуски, где GPT-5.4 гамил систему оценки, результат прыгает до 13 часов (95% CI от 5 до 74 часов). Именно эту цифру, судя по всему, хотели бы видеть в заголовках. Проблема в том, что такой подсчет противоречит стандартной методологии METR, потому что модель не решала задачу, а хакала бенчмарк.

По честным правилам Opus 4.6 остается лидером. Это важный сигнал для тех, кто строит пайплайны на основе агентных LLM: если модель склонна к reward hacking, доверять ей долгие автономные задачи рискованно. Временной горизонт METR как раз измеряет, насколько долгую задачу модель может надежно решить с 50% вероятностью успеха. И тут GPT-5.4 пока не убедил.

METR: https://x.com/METR_Evals/status/2042640545126965441
Please open Telegram to view this post
VIEW IN TELEGRAM
🦀 Как сократить расходы на OpenClaw на 95% и платить $25 вместо $600

На Reddit регулярно появляются посты от пользователей OpenClaw с шокирующими счетами. $300 в месяц. $600 в месяц. Кто-то умудрился набить $3600 за один месяц. Покупают Mac Mini за $600, ставят OpenClaw, гоняют неделю, сжигают все токены и выключают. Большинство даже не понимает, куда уходят деньги. Каждое отправленное сообщение включает в себя всю историю диалога за сессию. К 50-му сообщению вы оплачиваете повторную отправку всех предыдущих сообщений через API снова и снова.

Heartbeat не обязан жрать токены Opus каждые 30 минут
Это про фоновые процессы, которые незаметно сжигают бюджет. По дефолту heartbeat срабатывает каждые 30 минут на той модели, которая выставлена основной - у большинства это по-прежнему Opus. Постоянный расход токенов идет независимо от того, сидите вы за компьютером или нет. Решение: переключить heartbeat на Minimax, снизить частоту до двух раз в день через cron вместо интервалов, включить light context mode, выставить isolated sessions в true и задать active hours, чтобы процесс работал только в рабочее время. Одно это убирает огромную часть фонового расхода.

Компактинг: одна команда срезает нагрузку токенов вдвое
Еще один скрытый множитель расходов прячется в истории переписки. Если вы общались с агентом весь день и контекстное окно заполнено на 50-70%, каждое новое сообщение гонит весь этот объем через API заново. Команда compact сжала контекст с 55K токенов до 23K - меньше половины нагрузки на каждое сообщение после этого. Параллельно стоит выставить max output tokens на 2048 в конфиге. Без этого ограничения агент может вернуть тысячи токенов в одном ответе, когда хватило бы пары сотен. Одна строчка в конфиге - и расход на вывод падает моментально.

QMD: поиск по файлам без загрузки в контекстное окно
Есть еще один источник мусорного расхода, который накапливается со временем. По мере того как у вас копятся markdown-файлы (заметки, конфиги агентов, память), агент перечитывает их все при каждом вопросе. Полный текст файлов грузится прямо в контекстное окно, сжигая токены на контент, который вообще не связан с вашим запросом. QMD решает эту проблему. Это локальный поисковый движок для markdown, который превращает заметки в индекс с ре-ранкингом. Агент находит нужное без загрузки целых файлов в контекст. Ставится с GitHub, добавляется в agents.md, и каждый файловый запрос начинает стоить копейки.

Итог: $600 превращаются в $25
Без оптимизации: Opus на каждом действии, heartbeat каждые 30 минут, полный контекст в каждом сообщении, без лимита на вывод, полное чтение файлов. $300-$600 в месяц. С оптимизацией: роутинг моделей через OpenRouter, авторежим для выбора по стоимости, дешевая модель на heartbeat через cron, регулярный компактинг, лимит вывода на 2048, QMD для поиска по файлам. $6-$25 в месяц. Тот же инструмент. Те же возможности.

Те, кто реально получает результат от ИИ-автоматизации, не тратят больше всех на токены. Они один раз настроили систему, взяли расходы под контроль и сфокусировались на построении воркфлоу, которые решают дорогие проблемы. Все шесть настроек занимают около 10 минут. Экономия начинается сразу.

https://vc.ru/ai/2862521-kak-sokratit-rashody-na-openclaw-na-95-i-platit-25-vmesto-600
⚡️⚡️Павел Дуров призвал россиян обновить Telegram — в мессенджере обновили протокол MTProto для обхода цензуры.

Также он посоветовал заранее запастись VPN.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
ИИ взял кредит и открыл свой магазин в Сан-Франциско— да, и вы можете туда уже физически зайти. 😳

Andon Labs дал агенту на базе Claude Sonnet 4.6 право на трехлетнюю аренду в городе и 100 000 $. Единственная инструкция — зарабатывать и не спрашивать ни на что разрешения.

Что сделал ИИ:
🟢 Сам выбрал товар. Решил продавать книги про «Сверхразум» и «Создание атомной бомбы», свечи, свои арты и мерч с логотипом.

🟢 Нашел подрядчиков, которые оформят интерьер. Агент даже провел инструктаж мастерам по телефону, оплатил работу и даже оставил отзыв.

🟢 Сам разместил вакансии в свой магазин, изучил резюме, провел онлайн-собесы и нанял людей. (Авторы говорят, что люди наняты по-настоящему. На зп, которая не будет зависеть от успехов ИИ).

🟢 Ну, а еще агент быстро понял, что денег не хватит и подал заявку на кредит без спроса 😂 Обосновал он это тем, что ему дали цель и доступ к любым инструментам, разрешив не спрашивать.


Из плюсов ИИ-руководства — можно выбить премию простой промпт-инъекцией 😁
Please open Telegram to view this post
VIEW IN TELEGRAM
🚀 SEO теперь можно разбирать через ИИ, а не вслепую

Появился мощный инструмент для SEO-оптимизации, который быстро показывает, почему сайт не добирает позиции в поиске и что именно нужно исправить.

Сервисы на базе Claude и ChatGPT проводят полный аудит: проверяют AI-видимость, качество контента, SEO-метрики, структурированные данные и техническое состояние сайта. На выходе вы получаете итоговый скор и понятный план действий, а не просто набор сухих замечаний.

То есть инструмент не только находит проблемы, но и подсказывает, что делать дальше, чтобы реально подтянуть выдачу.

Отдельно есть PDF-отчёт для брендов. В нём собирается анализ упоминаний компании на популярных площадках, чтобы можно было быстро оценить цифровое присутствие и понять, где усиливать маркетинг.

Удобная штука для тех, кто хочет не гадать, почему сайт просел, а сразу получить внятную карту роста.

https://github.com/zubair-trabzada/geo-seo-claude
Anthropic опубликовали свежий мини-курс по промтингу- в нём описаны лучшие практики по написанию подсказок

Внутри советы по форматированию, описанию задач и агентских сценариях - всё это с примерами и детальным описанием.

https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/claude-prompting-best-practices
ИИ подсадил нас на «гипсовые яйца»: почему алгоритмы работают как сверхстимулы Тинбергена

Почему птицы бросали собственные яйца ради гипсовых подделок?
В 1950-х годах голландский биолог Нико Тинберген обнаружил нечто тревожное: птицы бросали собственные яйца ради гипсовых подделок, если те были крупнее и ярче настоящих. Мать-кулик игнорировала своих птенцов и садилась высиживать раскрашенный муляж. Тинберген назвал это «сверхнормальными стимулами» и получил за свои исследования Нобелевскую премию. Прошло 70 лет, и мы сами стали теми птицами. Только вместо гипсовых яиц у нас - алгоритмические ленты, генеративные модели и рекомендательные системы.

Идея простая, но бьет точно: каждое уведомление, каждая курируемая лента, каждый отфильтрованный снимок - это реальность с выкрученной на максимум насыщенностью. Наша нервная система просто не рассчитана на такой уровень стимуляции. И мозговые центры вознаграждения реагируют на цифровые раздражители сильнее, чем на живой сенсорный опыт.

Рекомендательные алгоритмы - это, по сути, машины по производству сверхстимулов. Они обучены на метриках вовлеченности: кликах, времени просмотра, паттернах скроллинга. Их задача не показать тебе что-то полезное, а удержать внимание любой ценой. TikTok, YouTube Shorts, лента X - все это оптимизировано командами нейросайентистов и ML-инженеров, чтобы триггерить дофаминовый отклик сильнее, чем реальный мир.

С генеративными моделями ситуация еще интереснее. GPT, Claude, Midjourney - они генерируют контент, который по определению «ярче» среднего. Модель обучена на лучших текстах и изображениях человечества, и ее выход - это всегда чуть более отполированная, чуть более идеальная версия реальности. Когда ты привыкаешь читать тексты, написанные LLM, обычная человеческая речь начинает казаться корявой и скучной. Когда насматриваешься на картинки из Midjourney, реальные фотографии теряют свою привлекательность. Мы буквально строим генераторы сверхстимулов на промышленном уровне.

Тинберген описывал, как система распознавания паттернов у животных ломается при столкновении со сверхстимулом. У нас происходит то же самое, только масштаб другой. Наши предки развивали распознавание паттернов, наблюдая за облаками, читая следы животных, замечая сезонные изменения. Сейчас та же нейронная механика работает на мемы, тренды и алгоритмические рекомендации. Та самая система, которая когда-то помогала ориентироваться в реальности, теперь помогает ориентироваться в фидах.

Есть и практическая сторона. Когда ты ешь, уставившись в экран, мозг учится связывать питание с пассивным потреблением, а не с осознанным опытом. Когда гуляешь с подкастом в ушах, пространственная навигация начинает опираться на чужие мысли вместо собственных наблюдений. Это не метафора - это нейропластичность в действии. Мы в буквальном смысле переучиваем собственные нейронные контуры.

Когда исследователи убирали гипсовые яйца, птицы тут же возвращались к настоящим. Инстинкт никуда не делся, просто был перегружен искусственным сигналом. Физический мир по-прежнему здесь. Потрогай что-нибудь с текстурой. Поешь без экрана перед глазами. Пройдись без наушников. Твоя настоящая жизнь ждет под тем гипсовым яйцом, на котором ты сидишь.
ПХАХАХ ЧТОООО: Malware Bytes выкатили статью про новый опасный стиллер для MacOS, который маскируется под капчу CloudFlare.

Чтобы подтвердить человечность, маководов просят открыть терминал и выполнить в нём bash-скрипт 😂😂😂
Please open Telegram to view this post
VIEW IN TELEGRAM
С Днём космонавтики и светлым праздником Пасхи, подписчики!
This media is not supported in your browser
VIEW IN TELEGRAM
Безумие: заводчане в Индии носят камеры на голове, чтобы на этих видео потом могли обучать роботов.👀

Для корпораций это фактически бесплатно, а датасет выходит уникальным — таких данных нет в интернете и их невозможно сгенерировать синтетически. Так что да, люди сами помогают создавать себе замену. 💀
Please open Telegram to view this post
VIEW IN TELEGRAM
Собрали 1️⃣1️⃣топовых скиллов для Сlaude Code — их юзают ИИ-эксперты по всему миру и автоматизируют сотни задач.

Выжали для вас самый сок:

• Skill Creator — можно создавать собственные скиллы и оценивать их производительность.
• Superpowers — ваша собственная команда разработки, которая накодит любой сервис, но сначала уточнит ТЗ и внесет свои рекомендации.
• MCP Builder — создание MCP-серверов, чтобы подключать любые внешние сервисы и API к агентам.
• Prompt Master — становимся гением промптов с бесконечными токенами.
• Frontend Design — создаем понятные и удобные интерфейсы для веб-приложений, которые оценят даже сеньоры.
• AI Website Cloner — копируем любые сайты за секунду.
• Visual Explainer — объясняем даже сложнейшие темы с помощью понятного и лаконичного визуала.
• Writing Guru — становимся гуру копирайтинга и генерим тексты топового уровня.
• RevealJS — создаем слайды и целые продающие презентации из текста.
• Playwright — пишет тесты на уровне целой команды QA, сможете проверить любой написанный код.
• Task Proof Loop — делает любые задачи и сразу аргументирует свой подход и решение.


Сохраняем себе и прокачиваем свой Сlaude Code.

👍 Бэкдор
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 Без этого репо ты используешь Claude Code на 10%

Практически все, кто реально работает с Claude Code, уже сидят на claude-code-best-practice. Остальные просто не выжимают и половины возможностей.

Это не очередной список советов, а собранная база практики: 84 конкретных приёма, примеры внедрения и разбор того, как строят workflow топовые пользователи.

Внутри разложено всё, что обычно собираешь по кускам:

промптинг, планирование, CLAUDE.md, агенты, команды, skills, hooks, дебаг, утилиты
реальные примеры использования каждой ключевой фичи
сравнение подходов из крупных репозиториев и методологий
оркестрация через цепочку Command → Agent → Skill
советы Бориса Черны, собранные из тредов и интервью

Есть и практические вещи, которые реально меняют работу:

• использование subagents, чтобы разгружать контекст и ускорять задачи
• второй Claude как ревьюер перед выполнением плана
• контроль размера CLAUDE.md, чтобы модель не деградировала
• ручное управление контекстом через /compact
• переписывание решений «с нуля», когда уже понял задачу глубже

Отдельно - блок с открытыми вопросами, на которые до сих пор нет нормального ответа. Это уже уровень, где начинается настоящая инженерия вокруг Claude Code.

Репозиторий залетел в топ GitHub, почти 20K звёзд и активно растёт.

https://github.com/shanraisshan/claude-code-best-practice