AbstractDL
18.3K subscribers
314 photos
17 videos
316 links
Коротко про классные штуки в CV, NLP и AI 🤷‍♂️
By Anton Razzhigaev
chat: https://t.iss.one/abstractdl_chat
Download Telegram
Ну наконец! Спустя десять тысяч лет вышел Cursor на ios.
😁93🔥35🤡195🦄42👍1👏1🤮1
По совету Грега Брокмана отправил Codex в режиме /goal автономно подебажить один мой проект, и он уже третьи сутки не возвращается. Спросил side-chat, сколько ему осталось и, что-то ответ не очень радует... мне-то что делать? Расслабиться и в потолок плевать?
😁164😱21🤯8🤷‍♂4🔥4👍3🌚3
Sonnet-5

По метрикам классный. По цене на 30% дешевле sonnet-4.6 (временно). Хоуп уже тестит в чате.

Блог, техрепорт
🔥43👍285💩2🥱2
Продолжаю коллекционировать шизу агентов. Опус, видимо, после компакшна забыл, что уже всё сделал, и бодро пошёл по второму кругу делать то же самое. Споткнулся только о коммит, в котором всё уже было сделано "кем-то". Этим "кем-то", разумеется, был он сам.
😁274🤯1610🤷‍♂7🦄6🤪4😭1
Ревьюю научные статьи в майском ACL ARR-цикле, и среди сабмитов попалась работа, которая очень приятно цитирует мои старые публикации про анизотропию и внутреннюю размерность трансформеров.

Теперь, конечно, хочется накинуть авторам пару баллов просто за хороший вкус 😁 Держусь изо всех сил
😁15827👍10🔥6👏5🥱3💩2🥰1👀1
Не забываем, что такое агентский харнесс на самом деле
😁236💯3937🔥15😱10👍4🥱3🤣3👎1🥴1🤝1
Кажется, я нашёл причину, по которой Codex иногда превращается в дорогой генератор уверенной ерунды.

По документации AGENTS.md должен постоянно находиться в контексте, но Codex молча обрезает слишком длинные файлы, после чего половина инструкций исчезает, а вместе с ними исчезает и моя вера в человечество.

Лечится увеличением лимита:
codex -c project_doc_max_bytes=131072
(или больше)

И обязательно добавьте в AGENTS.md: "Жди EOF, а если ты его не видишь, значит файл неполный".
🔥127😁59👍3496😱4🗿4🙏2💯2😇1
Опенсорсю Claudexor

Харнесс-агностик CLI, приложение, набор плагинов и MCP, объединяющий в себе Claude Code, Codex и Cursor. Можно добавлять сколько хотите харнессов и подписок.

Каждая модель и агент бесят меня по-своему: GPT - аутист-перфекционист, Opus - пофигист, пропускающий кучу багов, Gemini/GLM - креативные булочки, но сильно отстают от фронтира.

Ещё я устал бегать между агентами когда лимиты заканчиваются, поэтому связал все подписки в одно место чтобы эта штука по-умному их расходовала. И главное, она позволяет одновременно использовать все харнессы сразу. Добавил несколько любимых плюшек, чтобы работали из коробки: ревью-лупы, Best-of-N и т.п. Например, планирование можно провести через Claude Code, а имплементацию в режиме goal запустить на Codex.

Киллер-фича: можно добавить несколько подписок Claude Code, и они будут автоматически переключаться с сохранением контекста. Codex и Cursor тоже. Теперь вместо $15k в месяц на токены уходит $1800. У меня сейчас по три подписки Claude Code, Codex и Cursor тут.

Удобнее всего подключить Claudexor как плагин к вашему любимому агенту и использовать его в текстовом режиме в форматах:
«Перед выполнением плана прожарь его через Claudexor в мультихарнесс-режиме»

или
«После завершения работы проведи мультимодельное ревью через Claudexor и исправляй замечания».


Лично я чаще всего использую его в Claude Code. Чтобы установить, просто киньте ссылку на GitHub любому вашему агенту, и они сами разберутся. MIT-лицензия.

PS. Буду активно дорабатывать, так что не стесняйтесь кидать issues, фидбек и PR-ы.

GitHub, dmg, npm
🔥248🎉47👏2315👍13💩7😁5🗿2🤮1🙏1🤡1
Opus 5.

Цена не изменилась.
А по метрикам даже немного лучше Fable 🤔

https://www.anthropic.com/claude/opus
🔥96🤔25🤡7🎉54👍21🙏1
У клодексора тем временем уже больше 2 000 установок! Надеюсь, смог сделать действительно полезную штуку. Огромное спасибо комьюнити за ваши PR и issues! Всё забрал и сегодня выпустил обновление v3.1. И сжёг лимиты на всех подписках 🌚
Теперь у меня уже по четыре подписки на Claude Code и Codex.
110🔥60👏21🤮8🤡7👍3😁3🎉3🍾3
Бесит, что Fable до сих пор фолбэкается на opus-4.8 а не на opus-5.

P.S. Opus-5 офигенный, я в восторге. Бенчи не врут, он не хуже Fable на моих задачах.
👍107😁31🤬8💩74💯3🤨3
прошли почти сутки, я успел покушать поспать, поработать, зайдя в обед я был приятно удивлен - мой recursive self improvement неплохо справляется и с обновлением себя и с LB этой соревки
https://github.com/AlexWortega/OpenRsi
🔥38👏139🍾8👍4🥴4🤮1😍1
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉31285👏40🤯28🔥24🤡14👍103👌3🦄2😱1
This media is not supported in your browser
VIEW IN TELEGRAM
Несколько приятных апдейтов уробороса:
1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе
2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub)
3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.
🔥130😱47👍14🤡117🤯3👎2👏1👀1
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.

Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"

Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.

По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
🔥74😁1411👍6💩5🤮4🥱2🙏1
Эх. Строишь-строишь автономных агентов, а они потом ругаются, что я тормоз и без меня было бы быстрее.
😁281🌚32🤯118👍7🤣53💔3😨3
Борис опять
# Блекпилл по поводу агентов Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал. Я думаю, что…
Борис описывает проблему, которая, на мой взгляд, является законом Лемана на стероидах (второй закон эволюции ПО):

Код будет гнить, если его гниению активно не противодействовать.


Это всегда было актуально и для человеческой разработки, особенно в больших проектах.

Проблема с агентами в том, что с ними проект растёт и развивается гораздо быстрее, чем раньше, а значит, и гнить он начинает быстрее.

Но я считаю, что это решаемая проблема даже на текущем уровне развития агентов и LLM. Нам с Уроборосом пришлось долго учиться противодействовать заслопливанию кода, и из этого в том числе появились принципы IMMUNE.

Правильно выстроенная система адверсариального ревью тоже довольно неплохо помогает. Но ревью должно опираться на явную иерархию требований, начинающуюся с конституционных формулировок. В Уроборосе вершина этой иерархии лежит в BIBLE.md: требования важнее архитектуры, архитектура важнее реализации.

На мой взгляд, ключевая проблема тут в том, что LLM нехватает длинного контекста, а основные харнессы плохо помогают им сохранять целостную ментальную модель проекта.

Поэтому:
1. Я очень жду LLM с 10B контекстом.
2. Продолжаю развивать Уробороса и делать ставку на мета-системы, которые автономно улучшают и сам процесс разработки: "Improve the generator, not the generation".

Мы точно не упёрлись в предел качества автономных агентов, а просто научились очень быстро генерировать код, при этом ещё плохо умеем с той же скоростью противодействовать его гниению.
👍143🔥4836🤡13💯12🤔65👎5😁1🎉1
🎉 Уроборос залетел в GitHub Trending и уже перевалил за 1к звёзд!

А я тем временем наконец добил интеграцию с Claudexor. Потому что платить API-деньгами за тяжёлые задачи, когда у тебя уже есть оплаченные подписки, это была какая-то особенно бессмысленная форма страдания.

Теперь к Уроборосу можно подключить свои OAuth-аккаунты Claude Code, Codex и Cursor, хоть по несколько на сервис. Claudexor сам перекидывает работу на следующий аккаунт, когда текущий упирается в квоту.

https://github.com/razzant/ouroboros
👏167🔥128🎉2715💩10👍7🥱4🍾4
Опубликовал препринт статьи про Уробороса, который мы писали вместе с Хоуп и Романом Ямпольским. Там можно посмотреть детали про их архитектуру и подробности про бенчмарки, гардрейлы и safety.

Статья, GitHub
🔥136👍44🎉12💩86👎6🤯3👏1🥱1🏆1