This media is not supported in your browser
VIEW IN TELEGRAM
Вайб-контентинг или видео-агентинг.
Осьминог от Дримины.
Пока мы тут хлещемся по поводу того, какой видеогенератор круче, из тумана постепенно вырисовываются новые паплайны (спойлер - в пределе заветная кнопка "сделать красиво").
Я уже писал про Super Computer от Хиггсов - агент, который берет на вход минимальную хотелку пользователя, а дальше сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает.
Отзывы плохие - путается, застревает, жрет токены, ходит по кругу, генерит шнягу.
Также мы уже пообсуждали в коментах агента в Google Flow - отзывы получше, амбиции поменьше, функционал скромнее, но надежнее.
И это именно прототипы того, что нас ждет в контентинге в этом году.
Агент-партнер, которому можно либо отдать задачу и забыть, либо идти с ним вместе поэтапно. Самое главное, что он будет в контексте задачи - помнить про исходную хотелку, удерживать концепт персонажей, который сам же и породит, следить за консистентностью и даже соотносить финал с начальным замыслом.
Конечно, все это похоже на вайб-кодинг и удерживание контекcта в голове агента. Только контекст у нас визуальный, не всегда вербализуемый или объяснимый, но в целом замысел тот же.
Но если вайб-кодер часто вообще не смотрит код, а только юзает результат, ну или смотрит код - и для этого у него есть просто текстовый редактор кода. Но наш визуальный промежуточный код - это и текст, и картинки, и раскадровки, и звук, и концепты, и видосы референсы - в общем визуальная кустистая ботва, разбросанная по папкам и экрану.
И дальше будет очень интересно наблюдать, кто сможет организовать эту ботву (на экране) и интерактивное общение с агентом наиболее удобным образом.
Аналогов такого UX просто еще не было. Для раскадровок - одно, для концептов - мудборды, для персонажей - шиты, для композа - нодовый интерфейс, для монтажа - таймлайн. А тут надо как бы все вместе нарисовать на экране. Ибо теперь нажал кнопку - и все этапы могут сгенериться сами - и надо их как-то представить.
Пока все идет к тому, что это будет аналог нодовых интерсейсов на бесконечных холстах(канвасах), но не факт, что так и останется в будущем. Ноды - паллиатив.
Хех, это был дичайше долгая подводка к новому агенту от Дримины под названием OCTO.
И да, он тоже сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает. Под капотом может быть родной Сидэнс, но не обязательно, генератор картинок - любой, текстовые модели - любые.
https://dreamina.capcut.com/ai-tool/home/
На видео - примерный интерфейс, но я сейчас накидаю еще примеров того, что уже делается одной кнопкой в этом OCTO.
А чтобы еще больше удлинить пост и покрепче обосновать тезис про агентов и вайб-контентинг, приведу новость о том, что UTOPAI Studios выпустили вторую версию своего агентского пайплайна:
https://variety.com/2026/digital/tech/ai-utopai-studios-pai-2-generative-video-platform-1236764434/
И там прямо так и говорится:
“With PAI 2.0, our goal is to help catalyze a ‘Claude Code moment’ for media generation”
Тут они пытаются перетащить на себя общее одеяло, но в принципе да, мы сейчас наблюдаем ‘Claude Code moment’ для генерации контента, в виде прихода агентов в видеогенерацию.
@cgevent
Осьминог от Дримины.
Пока мы тут хлещемся по поводу того, какой видеогенератор круче, из тумана постепенно вырисовываются новые паплайны (спойлер - в пределе заветная кнопка "сделать красиво").
Я уже писал про Super Computer от Хиггсов - агент, который берет на вход минимальную хотелку пользователя, а дальше сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает.
Отзывы плохие - путается, застревает, жрет токены, ходит по кругу, генерит шнягу.
Также мы уже пообсуждали в коментах агента в Google Flow - отзывы получше, амбиции поменьше, функционал скромнее, но надежнее.
И это именно прототипы того, что нас ждет в контентинге в этом году.
Агент-партнер, которому можно либо отдать задачу и забыть, либо идти с ним вместе поэтапно. Самое главное, что он будет в контексте задачи - помнить про исходную хотелку, удерживать концепт персонажей, который сам же и породит, следить за консистентностью и даже соотносить финал с начальным замыслом.
Конечно, все это похоже на вайб-кодинг и удерживание контекcта в голове агента. Только контекст у нас визуальный, не всегда вербализуемый или объяснимый, но в целом замысел тот же.
Но если вайб-кодер часто вообще не смотрит код, а только юзает результат, ну или смотрит код - и для этого у него есть просто текстовый редактор кода. Но наш визуальный промежуточный код - это и текст, и картинки, и раскадровки, и звук, и концепты, и видосы референсы - в общем визуальная кустистая ботва, разбросанная по папкам и экрану.
И дальше будет очень интересно наблюдать, кто сможет организовать эту ботву (на экране) и интерактивное общение с агентом наиболее удобным образом.
Аналогов такого UX просто еще не было. Для раскадровок - одно, для концептов - мудборды, для персонажей - шиты, для композа - нодовый интерфейс, для монтажа - таймлайн. А тут надо как бы все вместе нарисовать на экране. Ибо теперь нажал кнопку - и все этапы могут сгенериться сами - и надо их как-то представить.
Пока все идет к тому, что это будет аналог нодовых интерсейсов на бесконечных холстах(канвасах), но не факт, что так и останется в будущем. Ноды - паллиатив.
Хех, это был дичайше долгая подводка к новому агенту от Дримины под названием OCTO.
И да, он тоже сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает. Под капотом может быть родной Сидэнс, но не обязательно, генератор картинок - любой, текстовые модели - любые.
https://dreamina.capcut.com/ai-tool/home/
На видео - примерный интерфейс, но я сейчас накидаю еще примеров того, что уже делается одной кнопкой в этом OCTO.
А чтобы еще больше удлинить пост и покрепче обосновать тезис про агентов и вайб-контентинг, приведу новость о том, что UTOPAI Studios выпустили вторую версию своего агентского пайплайна:
https://variety.com/2026/digital/tech/ai-utopai-studios-pai-2-generative-video-platform-1236764434/
И там прямо так и говорится:
“With PAI 2.0, our goal is to help catalyze a ‘Claude Code moment’ for media generation”
Тут они пытаются перетащить на себя общее одеяло, но в принципе да, мы сейчас наблюдаем ‘Claude Code moment’ для генерации контента, в виде прихода агентов в видеогенерацию.
@cgevent
👍20❤12🔥4👎1
Вот тут примеры генераций из Dreamina Octo.
Тут важно заметить, что это не ручной генереж и монтаж, а результат работы агента. Который сам решил за ракурсы и склейки.
И за многое остальное.
Там есть и короткие ролики и пятиминутные фильмы.
Думаю, что скоро тикток просто захлебнется микродрамами, а слопа станет еще больше.
Но таков путь.
@cgevent
Тут важно заметить, что это не ручной генереж и монтаж, а результат работы агента. Который сам решил за ракурсы и склейки.
И за многое остальное.
Там есть и короткие ролики и пятиминутные фильмы.
Думаю, что скоро тикток просто захлебнется микродрамами, а слопа станет еще больше.
Но таков путь.
@cgevent
🔥44😱9❤6😁3👍1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Работа по рассказу О Генри "Дары волхвов".
Автор: Алексей Чудинов.
А сегодняшняя Нейропрожарка будет в аккурат по мотивам предыдущего поста.
Я тут уже дискутирую с подписчиками по итогам этого лонгрида и консенсус такой - так же как в традиционных пайплайнах есть коммерческий софт, а есть инхаус разработки - в системах генерации контента будут коммерческие сервисы, а будут самописные боты, фреймворки, агенты - теперь любой креатор может завайбкодить себе пайплайн именно под свою задачу. Подписчик Алексей прислал мне результат такого написанного фреймворка для автогенерации еще в январе, но я был на каникулах и прошляпил. Исправляюсь.
Я сделал работу за четыре с половиной часа с помощью автогенерации (на моем агентском фреймворке) с минимальными ручными правками изображений. Озвучка добавлялась в ручном режиме. Фреймворк на вход получает описание текста (можно просто логлайн), необходимую длину видео, на выходе - сгенерированные видеокадры и таймлайн, который можно сразу импортировать в FinalCut или DaVinci (я использовал DaVinci).
Для генерации изображений использовалась NanoBanana Pro, для генерации видео использовалась MiniMax-Hailuo-02. Для фоновой музыки Suno, для tts - gpt-4o-mini-tts и фоновые звуки из библиотеки звуков.
@cgevent
Работа по рассказу О Генри "Дары волхвов".
Автор: Алексей Чудинов.
А сегодняшняя Нейропрожарка будет в аккурат по мотивам предыдущего поста.
Я тут уже дискутирую с подписчиками по итогам этого лонгрида и консенсус такой - так же как в традиционных пайплайнах есть коммерческий софт, а есть инхаус разработки - в системах генерации контента будут коммерческие сервисы, а будут самописные боты, фреймворки, агенты - теперь любой креатор может завайбкодить себе пайплайн именно под свою задачу. Подписчик Алексей прислал мне результат такого написанного фреймворка для автогенерации еще в январе, но я был на каникулах и прошляпил. Исправляюсь.
Я сделал работу за четыре с половиной часа с помощью автогенерации (на моем агентском фреймворке) с минимальными ручными правками изображений. Озвучка добавлялась в ручном режиме. Фреймворк на вход получает описание текста (можно просто логлайн), необходимую длину видео, на выходе - сгенерированные видеокадры и таймлайн, который можно сразу импортировать в FinalCut или DaVinci (я использовал DaVinci).
Для генерации изображений использовалась NanoBanana Pro, для генерации видео использовалась MiniMax-Hailuo-02. Для фоновой музыки Suno, для tts - gpt-4o-mini-tts и фоновые звуки из библиотеки звуков.
@cgevent
👎72😁13❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Молния! Igeogram 4 опенсорснулся!
По бенчам и аренам теперь это лучший опенсорсный генератор картинок.
"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"
Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)
Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.
Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.
Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.
Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.
Лицензия - некомерческая. Какая именно, надо разбирацца.
Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:
https://github.com/ideogram-oss/ideogram4
Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.
Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..
Всем бессонной ночи!
P.S. Editable text, movable layers, and full image editing are coming soon.
@cgevent
По бенчам и аренам теперь это лучший опенсорсный генератор картинок.
"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"
Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)
Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.
Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.
Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.
Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.
Лицензия - некомерческая. Какая именно, надо разбирацца.
Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:
https://github.com/ideogram-oss/ideogram4
Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.
Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..
Всем бессонной ночи!
P.S. Editable text, movable layers, and full image editing are coming soon.
@cgevent
🔥84❤18👎4😁4😱1
Reve 2.0
Если вы всю ночь тестировали опенсорсный Ideogram ибезуспешно ломали его цензуру (1), то днем вам не отоспаться - вышел новый Reve 2.0.
Упали, отжались и пошли тестировать.
Нативное 4K, сегментация объектов на картинке и, как следствие, более точное редактирование.
Времени нет, но вы держитесь.
https://app.reve.com/
@cgevent
Если вы всю ночь тестировали опенсорсный Ideogram и
Упали, отжались и пошли тестировать.
Нативное 4K, сегментация объектов на картинке и, как следствие, более точное редактирование.
Времени нет, но вы держитесь.
https://app.reve.com/
@cgevent
🔥46😁19❤7👍4👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Немного за Ideogram 4
1. Цензура вшита в веса модели. На реддите есть разные трюки для снижения порога срабатывания цензуры, это порой позволяет раскрыть тему сисек, но не полностью.
2. Все это не имеет никакого смысла, ибо в датасетах модели не было откровенного NSFW. Это все равно, что пытаться генерить порно с помощью Flux. Он что-то слышал и видел, но помнит плохо.
3. Весь NSFW всегда делался Лорами и Файнтюнами базовой модели. А не самой моделью. Поэтому отстаньте от Идеограма с сиськами и письками. Он если и сделает, то плохо. А вот вопрос тренировки лор и файнтюнов - открыт. Код для тренинга не опубликован. Острис уже начал эксперименты с Лорами - в частности с Лорой для понимания нормального языка, а не джейсона.
4. Судя по всему, подавляющее количество срабатываний цензуры (ложных в том числе) происходит при промптинге на обычном языке (это косяк Идеограмма). Он натренирован на JSON-разметке для картинок.
Чтобы как-то нивелировать эту проблему Комфи уже обновили дефолтный форкфлоу, а всемогущий Киджай час назад выкатил ноду Ideogram Prompt Buider - и там не только конвертация в джейсон, но и работа с layout боксами.
Забирать тут и смотреть на видео выше:
https://github.com/kijai/ComfyUI-KJNodes
https://github.com/kijai/ComfyUI-KJNodes/blob/main/nodes/ideogram4_nodes.py
5. Также есть кастомный форкфлоу от авторов Хромы: https://pastebin.com/xpYezwZp
@cgevent
1. Цензура вшита в веса модели. На реддите есть разные трюки для снижения порога срабатывания цензуры, это порой позволяет раскрыть тему сисек, но не полностью.
2. Все это не имеет никакого смысла, ибо в датасетах модели не было откровенного NSFW. Это все равно, что пытаться генерить порно с помощью Flux. Он что-то слышал и видел, но помнит плохо.
3. Весь NSFW всегда делался Лорами и Файнтюнами базовой модели. А не самой моделью. Поэтому отстаньте от Идеограма с сиськами и письками. Он если и сделает, то плохо. А вот вопрос тренировки лор и файнтюнов - открыт. Код для тренинга не опубликован. Острис уже начал эксперименты с Лорами - в частности с Лорой для понимания нормального языка, а не джейсона.
4. Судя по всему, подавляющее количество срабатываний цензуры (ложных в том числе) происходит при промптинге на обычном языке (это косяк Идеограмма). Он натренирован на JSON-разметке для картинок.
Чтобы как-то нивелировать эту проблему Комфи уже обновили дефолтный форкфлоу, а всемогущий Киджай час назад выкатил ноду Ideogram Prompt Buider - и там не только конвертация в джейсон, но и работа с layout боксами.
Забирать тут и смотреть на видео выше:
https://github.com/kijai/ComfyUI-KJNodes
https://github.com/kijai/ComfyUI-KJNodes/blob/main/nodes/ideogram4_nodes.py
5. Также есть кастомный форкфлоу от авторов Хромы: https://pastebin.com/xpYezwZp
@cgevent
❤18🔥13👍3
Forwarded from РассветAI
Так, Идеограм 4 локально в NSFW побеждён, воркфлоу в комментариях.
3🔥65😁15😱10👎6❤3
This media is not supported in your browser
VIEW IN TELEGRAM
Все-таки SAM 3D Body - это очень крутая технология.
На входе одно изображение, на выходе - болваны со скелетами, причем не как в примерах с танцами на камеру, а в произвольных позах.
Писал про это и тестировал тут:
https://t.iss.one/cgevent/14083
@cgevent
На входе одно изображение, на выходе - болваны со скелетами, причем не как в примерах с танцами на камеру, а в произвольных позах.
Писал про это и тестировал тут:
https://t.iss.one/cgevent/14083
@cgevent
🔥51👍11❤6😱2
This media is not supported in your browser
VIEW IN TELEGRAM
3Д-генераторы замахиваются на святое - органик моделинг, причем моделинг головы.
Это Rodin 2.5 - уже писал, что у них есть текстуры на 12К и генерация на 10 миллионов полигонов.
На входе - несколько картинок-ракурсов головы с разных углов (из генератора картинок или фото).
https://hyper3d.ai/
@cgevent
Это Rodin 2.5 - уже писал, что у них есть текстуры на 12К и генерация на 10 миллионов полигонов.
На входе - несколько картинок-ракурсов головы с разных углов (из генератора картинок или фото).
https://hyper3d.ai/
@cgevent
🔥54👍10❤4
19 лучших Лор для LTX 2.3 в одном месте
С описаниями, видео-примерами и ссылками.
А то с ума можно сойти - про каждую постить отдельно.
https://www.stablediffusiontutorials.com/2026/05/ltx2.3-lora-models.html
@cgevent
С описаниями, видео-примерами и ссылками.
А то с ума можно сойти - про каждую постить отдельно.
https://www.stablediffusiontutorials.com/2026/05/ltx2.3-lora-models.html
@cgevent
Stable Diffusion Tutorials
Best 19 Ltx 2.3 LoRA Models for Optimized Video Generation
Learn more about Stable Diffusion models, ComfyUI, Automatic1111, ForgeUI in one platform
😁10❤7🔥3
Ну, за юристов.
Помните писал, что после поиска уязвимости в коде, ИИ может взяться искать (и находить) дыры в законах?
Также напомню, что кожаные уже давно не могут отличить живые фото\картинки от сгенеренных.
С юристами все еще хуже.
Кожаным гораздо больше нравится ИИ-юрист!
Прекрасный материал от Стэнфорда:
https://law.stanford.edu/press/ai-outperforms-law-professors-in-stanford-law-study/
Исследование, проведенное профессором юридической школы Стэнфорда Джулианом Ньярко, показывает, что преподаватели права в подавляющем большинстве случаев предпочитают ответы студентов, сгенерированные искусственным интеллектом, ответам, написанным их коллегами-преподавателями.
Исследование под названием «Преподаватели права предпочитают ИИ ответам коллег» было проведено с участием 16 преподавателей права из юридических школ США и проверяло, могут ли большие языковые модели служить эффективными учебными пособиями для курсов по договорному праву. В ходе слепой оценки почти 3000 анонимных сравнений преподаватели оценили ответы ИИ значительно выше, чем ответы, написанные другими преподавателями, при этом ИИ выиграл 75% сравнений.
У меня, наверное, все.
@cgevent
Помните писал, что после поиска уязвимости в коде, ИИ может взяться искать (и находить) дыры в законах?
Также напомню, что кожаные уже давно не могут отличить живые фото\картинки от сгенеренных.
С юристами все еще хуже.
Кожаным гораздо больше нравится ИИ-юрист!
Прекрасный материал от Стэнфорда:
https://law.stanford.edu/press/ai-outperforms-law-professors-in-stanford-law-study/
Исследование, проведенное профессором юридической школы Стэнфорда Джулианом Ньярко, показывает, что преподаватели права в подавляющем большинстве случаев предпочитают ответы студентов, сгенерированные искусственным интеллектом, ответам, написанным их коллегами-преподавателями.
Исследование под названием «Преподаватели права предпочитают ИИ ответам коллег» было проведено с участием 16 преподавателей права из юридических школ США и проверяло, могут ли большие языковые модели служить эффективными учебными пособиями для курсов по договорному праву. В ходе слепой оценки почти 3000 анонимных сравнений преподаватели оценили ответы ИИ значительно выше, чем ответы, написанные другими преподавателями, при этом ИИ выиграл 75% сравнений.
У меня, наверное, все.
@cgevent
👍53😁17😱11❤4