Метаверсище и ИИще
51.4K subscribers
6.51K photos
5.32K videos
48 files
7.61K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Вайб-контентинг или видео-агентинг.

Осьминог от Дримины.

Пока мы тут хлещемся по поводу того, какой видеогенератор круче, из тумана постепенно вырисовываются новые паплайны (спойлер - в пределе заветная кнопка "сделать красиво").

Я уже писал про Super Computer от Хиггсов - агент, который берет на вход минимальную хотелку пользователя, а дальше сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает.
Отзывы плохие - путается, застревает, жрет токены, ходит по кругу, генерит шнягу.

Также мы уже пообсуждали в коментах агента в Google Flow - отзывы получше, амбиции поменьше, функционал скромнее, но надежнее.

И это именно прототипы того, что нас ждет в контентинге в этом году.

Агент-партнер, которому можно либо отдать задачу и забыть, либо идти с ним вместе поэтапно. Самое главное, что он будет в контексте задачи - помнить про исходную хотелку, удерживать концепт персонажей, который сам же и породит, следить за консистентностью и даже соотносить финал с начальным замыслом.

Конечно, все это похоже на вайб-кодинг и удерживание контекcта в голове агента. Только контекст у нас визуальный, не всегда вербализуемый или объяснимый, но в целом замысел тот же.

Но если вайб-кодер часто вообще не смотрит код, а только юзает результат, ну или смотрит код - и для этого у него есть просто текстовый редактор кода. Но наш визуальный промежуточный код - это и текст, и картинки, и раскадровки, и звук, и концепты, и видосы референсы - в общем визуальная кустистая ботва, разбросанная по папкам и экрану.
И дальше будет очень интересно наблюдать, кто сможет организовать эту ботву (на экране) и интерактивное общение с агентом наиболее удобным образом.

Аналогов такого UX просто еще не было. Для раскадровок - одно, для концептов - мудборды, для персонажей - шиты, для композа - нодовый интерфейс, для монтажа - таймлайн. А тут надо как бы все вместе нарисовать на экране. Ибо теперь нажал кнопку - и все этапы могут сгенериться сами - и надо их как-то представить.
Пока все идет к тому, что это будет аналог нодовых интерсейсов на бесконечных холстах(канвасах), но не факт, что так и останется в будущем. Ноды - паллиатив.

Хех, это был дичайше долгая подводка к новому агенту от Дримины под названием OCTO.
И да, он тоже сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает. Под капотом может быть родной Сидэнс, но не обязательно, генератор картинок - любой, текстовые модели - любые.

https://dreamina.capcut.com/ai-tool/home/

На видео - примерный интерфейс, но я сейчас накидаю еще примеров того, что уже делается одной кнопкой в этом OCTO.

А чтобы еще больше удлинить пост и покрепче обосновать тезис про агентов и вайб-контентинг, приведу новость о том, что UTOPAI Studios выпустили вторую версию своего агентского пайплайна:
https://variety.com/2026/digital/tech/ai-utopai-studios-pai-2-generative-video-platform-1236764434/

И там прямо так и говорится:

“With PAI 2.0, our goal is to help catalyze a ‘Claude Code moment’ for media generation”

Тут они пытаются перетащить на себя общее одеяло, но в принципе да, мы сейчас наблюдаем ‘Claude Code moment’ для генерации контента, в виде прихода агентов в видеогенерацию.

@cgevent
👍2012🔥4👎1
Вот тут примеры генераций из Dreamina Octo.

Тут важно заметить, что это не ручной генереж и монтаж, а результат работы агента. Который сам решил за ракурсы и склейки.
И за многое остальное.

Там есть и короткие ролики и пятиминутные фильмы.

Думаю, что скоро тикток просто захлебнется микродрамами, а слопа станет еще больше.

Но таков путь.

@cgevent
🔥44😱96😁3👍1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

Работа по рассказу О Генри "Дары волхвов".

Автор: Алексей Чудинов.

А сегодняшняя Нейропрожарка будет в аккурат по мотивам предыдущего поста.
Я тут уже дискутирую с подписчиками по итогам этого лонгрида и консенсус такой - так же как в традиционных пайплайнах есть коммерческий софт, а есть инхаус разработки - в системах генерации контента будут коммерческие сервисы, а будут самописные боты, фреймворки, агенты - теперь любой креатор может завайбкодить себе пайплайн именно под свою задачу. Подписчик Алексей прислал мне результат такого написанного
фреймворка для автогенерации еще в январе, но я был на каникулах и прошляпил. Исправляюсь.

Я сделал работу за четыре с половиной часа с помощью автогенерации (на моем агентском фреймворке) с минимальными ручными правками изображений. Озвучка добавлялась в ручном режиме. Фреймворк на вход получает описание текста (можно просто логлайн), необходимую длину видео, на выходе - сгенерированные видеокадры и таймлайн, который можно сразу импортировать в FinalCut или DaVinci (я использовал DaVinci).
Для генерации изображений использовалась NanoBanana Pro, для генерации видео использовалась MiniMax-Hailuo-02. Для фоновой музыки Suno, для tts - gpt-4o-mini-tts и фоновые звуки из библиотеки звуков.

@cgevent
👎72😁131
This media is not supported in your browser
VIEW IN TELEGRAM
Молния! Igeogram 4 опенсорснулся!

По бенчам и аренам теперь это лучший опенсорсный генератор картинок.

"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"

Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)

Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.

Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.


Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.

Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.

Лицензия - некомерческая. Какая именно, надо разбирацца.

Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:

https://github.com/ideogram-oss/ideogram4

Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.

Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..

Всем бессонной ночи!

P.S. Editable text, movable layers, and full image editing are coming soon.

@cgevent
🔥8418👎4😁4😱1
Reve 2.0

Если вы всю ночь тестировали опенсорсный Ideogram и безуспешно ломали его цензуру (1), то днем вам не отоспаться - вышел новый Reve 2.0.

Упали, отжались и пошли тестировать.

Нативное 4K, сегментация объектов на картинке и, как следствие, более точное редактирование.

Времени нет, но вы держитесь.

https://app.reve.com/

@cgevent
🔥46😁197👍4👎1
Ideogram покусал Krea

Они опенсорснут свою последнюю модель Krea K2.

@cgevent
😁44🔥13
This media is not supported in your browser
VIEW IN TELEGRAM
Немного за Ideogram 4

1. Цензура вшита в веса модели. На реддите есть разные трюки для снижения порога срабатывания цензуры, это порой позволяет раскрыть тему сисек, но не полностью.

2. Все это не имеет никакого смысла, ибо в датасетах модели не было откровенного NSFW. Это все равно, что пытаться генерить порно с помощью Flux. Он что-то слышал и видел, но помнит плохо.

3. Весь NSFW всегда делался Лорами и Файнтюнами базовой модели. А не самой моделью. Поэтому отстаньте от Идеограма с сиськами и письками. Он если и сделает, то плохо. А вот вопрос тренировки лор и файнтюнов - открыт. Код для тренинга не опубликован. Острис уже начал эксперименты с Лорами - в частности с Лорой для понимания нормального языка, а не джейсона.

4. Судя по всему, подавляющее количество срабатываний цензуры (ложных в том числе) происходит при промптинге на обычном языке (это косяк Идеограмма). Он натренирован на JSON-разметке для картинок.
Чтобы как-то нивелировать эту проблему Комфи уже обновили дефолтный форкфлоу, а всемогущий Киджай час назад выкатил ноду Ideogram Prompt Buider - и там не только конвертация в джейсон, но и работа с layout боксами.
Забирать тут и смотреть на видео выше:
https://github.com/kijai/ComfyUI-KJNodes
https://github.com/kijai/ComfyUI-KJNodes/blob/main/nodes/ideogram4_nodes.py

5. Также есть кастомный форкфлоу от авторов Хромы: https://pastebin.com/xpYezwZp

@cgevent
18🔥13👍3
Forwarded from РассветAI
Так, Идеограм 4 локально в NSFW побеждён, воркфлоу в комментариях.
3🔥65😁15😱10👎63
This media is not supported in your browser
VIEW IN TELEGRAM
Все-таки SAM 3D Body - это очень крутая технология.

На входе одно изображение, на выходе - болваны со скелетами, причем не как в примерах с танцами на камеру, а в произвольных позах.

Писал про это и тестировал тут:
https://t.iss.one/cgevent/14083

@cgevent
🔥51👍116😱2
This media is not supported in your browser
VIEW IN TELEGRAM
3Д-генераторы замахиваются на святое - органик моделинг, причем моделинг головы.

Это Rodin 2.5 - уже писал, что у них есть текстуры на 12К и генерация на 10 миллионов полигонов.

На входе - несколько картинок-ракурсов головы с разных углов (из генератора картинок или фото).

https://hyper3d.ai/

@cgevent
🔥54👍104
19 лучших Лор для LTX 2.3 в одном месте

С описаниями, видео-примерами и ссылками.

А то с ума можно сойти - про каждую постить отдельно.

https://www.stablediffusiontutorials.com/2026/05/ltx2.3-lora-models.html

@cgevent
😁107🔥3
Ну, за юристов.

Помните писал, что после поиска уязвимости в коде, ИИ может взяться искать (и находить) дыры в законах?

Также напомню, что кожаные уже давно не могут отличить живые фото\картинки от сгенеренных.

С юристами все еще хуже.

Кожаным гораздо больше нравится ИИ-юрист!

Прекрасный материал от Стэнфорда:
https://law.stanford.edu/press/ai-outperforms-law-professors-in-stanford-law-study/

Исследование, проведенное профессором юридической школы Стэнфорда Джулианом Ньярко, показывает, что преподаватели права в подавляющем большинстве случаев предпочитают ответы студентов, сгенерированные искусственным интеллектом, ответам, написанным их коллегами-преподавателями.

Исследование под названием «Преподаватели права предпочитают ИИ ответам коллег» было проведено с участием 16 преподавателей права из юридических школ США и проверяло, могут ли большие языковые модели служить эффективными учебными пособиями для курсов по договорному праву. В ходе слепой оценки почти 3000 анонимных сравнений преподаватели оценили ответы ИИ значительно выше, чем ответы, написанные другими преподавателями, при этом ИИ выиграл 75% сравнений.

У меня, наверное, все.

@cgevent
👍53😁17😱114