This media is not supported in your browser
VIEW IN TELEGRAM
AI-assisted retopology, UV unwrapping, GPU compute packing, and texture baking
Интересный новый софт Cozy Blanket - обещают ИИ-ретоп и Анврап.
Цен нет, доступа нет, сроков нет - но есть очень обещающие картинки и хорошо сделанный сайт.
Можно подписаться на обновления.
Подписался, заинтригован.
https://sparseal.com/cozyblanket-pro/
@cgevent
Интересный новый софт Cozy Blanket - обещают ИИ-ретоп и Анврап.
Цен нет, доступа нет, сроков нет - но есть очень обещающие картинки и хорошо сделанный сайт.
Можно подписаться на обновления.
Подписался, заинтригован.
https://sparseal.com/cozyblanket-pro/
@cgevent
🔥49😱8❤6
This media is not supported in your browser
VIEW IN TELEGRAM
Новые модели от Микрософта.
Они анонсировали семейство из семи новых моделей под брендом MAI для работы с изображениями, голосом и кодом.
MAI‑Thinking‑1 (ризонинг-модель, 35 миллиарда параметров, контект 128K)
MAI‑Code‑1-Flash
MAI‑Image‑2.5
MAI‑-Voice-2
Нас интересует (или не интересует) MAI‑Image‑2.5, которая на Арене взобралась на второе место в категории редактирования картинок, обойдя Банану. Что делает доверие к Арене еще более сомнительным.
С ценами на АПИ можно ознакомиться по ссылке, а но мне больше интересно, как Микрософт будет встраивать генерацию в продукты. Уже сейчас написано "MAI-Image-2.5 is live on PowerPoint for high-quality image generation and rolling out to OneDrive for precise editing."
@cgevent
Они анонсировали семейство из семи новых моделей под брендом MAI для работы с изображениями, голосом и кодом.
MAI‑Thinking‑1 (ризонинг-модель, 35 миллиарда параметров, контект 128K)
MAI‑Code‑1-Flash
MAI‑Image‑2.5
MAI‑-Voice-2
Нас интересует (или не интересует) MAI‑Image‑2.5, которая на Арене взобралась на второе место в категории редактирования картинок, обойдя Банану. Что делает доверие к Арене еще более сомнительным.
С ценами на АПИ можно ознакомиться по ссылке, а но мне больше интересно, как Микрософт будет встраивать генерацию в продукты. Уже сейчас написано "MAI-Image-2.5 is live on PowerPoint for high-quality image generation and rolling out to OneDrive for precise editing."
@cgevent
👍11❤7👎1🔥1
Forwarded from AI Product | Igor Akimov
This media is not supported in your browser
VIEW IN TELEGRAM
Codex теперь умеет выкладывать внутренние приложения
OpenAI зашёл на территорию Lovable и Replit, но пока только для внутренних сайтов.
Вчера на стриме «Intelligence at Work» OpenAI выкатил сразу три апдейта для Codex: шесть ролевых плагинов под бизнес-задачи, аннотации и – самое интересное – Sites.
Это плагин + managed-хостинг прямо внутри Codex. Просишь собрать приложение – Codex его строит, прогоняет, деплоит и возвращает ссылку, которую можно расшарить по воркспейсу. Весь цикл в одном треде, без ручной возни с инстансами и регионами (привет всем, кто пытался захостить локально собранное приложение в GCP или AWS).
Целятся во внутренние инструменты: онбординг-дашборды, базы знаний, борды для идей, репортинг-вью, лёгкие воркфлоу-приложения. То есть не «лендинг запилить», а «превратить рутину команды в живое приложение».
Добавили 2 фичи для хранения:
– D1 – SQLite-совместимая база под структурку: состояние чеклистов, закладки, фильтры, конфиги, метаданные файлов
– R2 – объектное хранилище под сами файлы: документы, картинки, ассеты
Любопытная деталь: D1 и R2 – это вообще-то названия продуктов Cloudflare. То есть «хостинг от OpenAI» под капотом едет на Cloudflare – OpenAI не строит инфру сам, а заворачивает чужую под свой бренд и свою авторизацию.
По дефолту приложение видят только владелец и админы воркспейса. Дальше открываешь либо на весь воркспейс (workspace_all), либо точечно на людей и группы (custom). Авторизация – через Sign in with ChatGPT. Пока превью для Business и Enterprise.
В общем, всем ChatGPT, пожираем всех ближайших конкурентов и GPT-врапперы.
https://developers.openai.com/codex/sites
OpenAI зашёл на территорию Lovable и Replit, но пока только для внутренних сайтов.
Вчера на стриме «Intelligence at Work» OpenAI выкатил сразу три апдейта для Codex: шесть ролевых плагинов под бизнес-задачи, аннотации и – самое интересное – Sites.
Это плагин + managed-хостинг прямо внутри Codex. Просишь собрать приложение – Codex его строит, прогоняет, деплоит и возвращает ссылку, которую можно расшарить по воркспейсу. Весь цикл в одном треде, без ручной возни с инстансами и регионами (привет всем, кто пытался захостить локально собранное приложение в GCP или AWS).
Целятся во внутренние инструменты: онбординг-дашборды, базы знаний, борды для идей, репортинг-вью, лёгкие воркфлоу-приложения. То есть не «лендинг запилить», а «превратить рутину команды в живое приложение».
Добавили 2 фичи для хранения:
– D1 – SQLite-совместимая база под структурку: состояние чеклистов, закладки, фильтры, конфиги, метаданные файлов
– R2 – объектное хранилище под сами файлы: документы, картинки, ассеты
Любопытная деталь: D1 и R2 – это вообще-то названия продуктов Cloudflare. То есть «хостинг от OpenAI» под капотом едет на Cloudflare – OpenAI не строит инфру сам, а заворачивает чужую под свой бренд и свою авторизацию.
По дефолту приложение видят только владелец и админы воркспейса. Дальше открываешь либо на весь воркспейс (workspace_all), либо точечно на людей и группы (custom). Авторизация – через Sign in with ChatGPT. Пока превью для Business и Enterprise.
В общем, всем ChatGPT, пожираем всех ближайших конкурентов и GPT-врапперы.
https://developers.openai.com/codex/sites
👍19❤8
This media is not supported in your browser
VIEW IN TELEGRAM
Вайб-контентинг или видео-агентинг.
Осьминог от Дримины.
Пока мы тут хлещемся по поводу того, какой видеогенератор круче, из тумана постепенно вырисовываются новые паплайны (спойлер - в пределе заветная кнопка "сделать красиво").
Я уже писал про Super Computer от Хиггсов - агент, который берет на вход минимальную хотелку пользователя, а дальше сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает.
Отзывы плохие - путается, застревает, жрет токены, ходит по кругу, генерит шнягу.
Также мы уже пообсуждали в коментах агента в Google Flow - отзывы получше, амбиции поменьше, функционал скромнее, но надежнее.
И это именно прототипы того, что нас ждет в контентинге в этом году.
Агент-партнер, которому можно либо отдать задачу и забыть, либо идти с ним вместе поэтапно. Самое главное, что он будет в контексте задачи - помнить про исходную хотелку, удерживать концепт персонажей, который сам же и породит, следить за консистентностью и даже соотносить финал с начальным замыслом.
Конечно, все это похоже на вайб-кодинг и удерживание контекcта в голове агента. Только контекст у нас визуальный, не всегда вербализуемый или объяснимый, но в целом замысел тот же.
Но если вайб-кодер часто вообще не смотрит код, а только юзает результат, ну или смотрит код - и для этого у него есть просто текстовый редактор кода. Но наш визуальный промежуточный код - это и текст, и картинки, и раскадровки, и звук, и концепты, и видосы референсы - в общем визуальная кустистая ботва, разбросанная по папкам и экрану.
И дальше будет очень интересно наблюдать, кто сможет организовать эту ботву (на экране) и интерактивное общение с агентом наиболее удобным образом.
Аналогов такого UX просто еще не было. Для раскадровок - одно, для концептов - мудборды, для персонажей - шиты, для композа - нодовый интерфейс, для монтажа - таймлайн. А тут надо как бы все вместе нарисовать на экране. Ибо теперь нажал кнопку - и все этапы могут сгенериться сами - и надо их как-то представить.
Пока все идет к тому, что это будет аналог нодовых интерсейсов на бесконечных холстах(канвасах), но не факт, что так и останется в будущем. Ноды - паллиатив.
Хех, это был дичайше долгая подводка к новому агенту от Дримины под названием OCTO.
И да, он тоже сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает. Под капотом может быть родной Сидэнс, но не обязательно, генератор картинок - любой, текстовые модели - любые.
https://dreamina.capcut.com/ai-tool/home/
На видео - примерный интерфейс, но я сейчас накидаю еще примеров того, что уже делается одной кнопкой в этом OCTO.
А чтобы еще больше удлинить пост и покрепче обосновать тезис про агентов и вайб-контентинг, приведу новость о том, что UTOPAI Studios выпустили вторую версию своего агентского пайплайна:
https://variety.com/2026/digital/tech/ai-utopai-studios-pai-2-generative-video-platform-1236764434/
И там прямо так и говорится:
“With PAI 2.0, our goal is to help catalyze a ‘Claude Code moment’ for media generation”
Тут они пытаются перетащить на себя общее одеяло, но в принципе да, мы сейчас наблюдаем ‘Claude Code moment’ для генерации контента, в виде прихода агентов в видеогенерацию.
@cgevent
Осьминог от Дримины.
Пока мы тут хлещемся по поводу того, какой видеогенератор круче, из тумана постепенно вырисовываются новые паплайны (спойлер - в пределе заветная кнопка "сделать красиво").
Я уже писал про Super Computer от Хиггсов - агент, который берет на вход минимальную хотелку пользователя, а дальше сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает.
Отзывы плохие - путается, застревает, жрет токены, ходит по кругу, генерит шнягу.
Также мы уже пообсуждали в коментах агента в Google Flow - отзывы получше, амбиции поменьше, функционал скромнее, но надежнее.
И это именно прототипы того, что нас ждет в контентинге в этом году.
Агент-партнер, которому можно либо отдать задачу и забыть, либо идти с ним вместе поэтапно. Самое главное, что он будет в контексте задачи - помнить про исходную хотелку, удерживать концепт персонажей, который сам же и породит, следить за консистентностью и даже соотносить финал с начальным замыслом.
Конечно, все это похоже на вайб-кодинг и удерживание контекcта в голове агента. Только контекст у нас визуальный, не всегда вербализуемый или объяснимый, но в целом замысел тот же.
Но если вайб-кодер часто вообще не смотрит код, а только юзает результат, ну или смотрит код - и для этого у него есть просто текстовый редактор кода. Но наш визуальный промежуточный код - это и текст, и картинки, и раскадровки, и звук, и концепты, и видосы референсы - в общем визуальная кустистая ботва, разбросанная по папкам и экрану.
И дальше будет очень интересно наблюдать, кто сможет организовать эту ботву (на экране) и интерактивное общение с агентом наиболее удобным образом.
Аналогов такого UX просто еще не было. Для раскадровок - одно, для концептов - мудборды, для персонажей - шиты, для композа - нодовый интерфейс, для монтажа - таймлайн. А тут надо как бы все вместе нарисовать на экране. Ибо теперь нажал кнопку - и все этапы могут сгенериться сами - и надо их как-то представить.
Пока все идет к тому, что это будет аналог нодовых интерсейсов на бесконечных холстах(канвасах), но не факт, что так и останется в будущем. Ноды - паллиатив.
Хех, это был дичайше долгая подводка к новому агенту от Дримины под названием OCTO.
И да, он тоже сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает. Под капотом может быть родной Сидэнс, но не обязательно, генератор картинок - любой, текстовые модели - любые.
https://dreamina.capcut.com/ai-tool/home/
На видео - примерный интерфейс, но я сейчас накидаю еще примеров того, что уже делается одной кнопкой в этом OCTO.
А чтобы еще больше удлинить пост и покрепче обосновать тезис про агентов и вайб-контентинг, приведу новость о том, что UTOPAI Studios выпустили вторую версию своего агентского пайплайна:
https://variety.com/2026/digital/tech/ai-utopai-studios-pai-2-generative-video-platform-1236764434/
И там прямо так и говорится:
“With PAI 2.0, our goal is to help catalyze a ‘Claude Code moment’ for media generation”
Тут они пытаются перетащить на себя общее одеяло, но в принципе да, мы сейчас наблюдаем ‘Claude Code moment’ для генерации контента, в виде прихода агентов в видеогенерацию.
@cgevent
👍20❤12🔥4👎1
Вот тут примеры генераций из Dreamina Octo.
Тут важно заметить, что это не ручной генереж и монтаж, а результат работы агента. Который сам решил за ракурсы и склейки.
И за многое остальное.
Там есть и короткие ролики и пятиминутные фильмы.
Думаю, что скоро тикток просто захлебнется микродрамами, а слопа станет еще больше.
Но таков путь.
@cgevent
Тут важно заметить, что это не ручной генереж и монтаж, а результат работы агента. Который сам решил за ракурсы и склейки.
И за многое остальное.
Там есть и короткие ролики и пятиминутные фильмы.
Думаю, что скоро тикток просто захлебнется микродрамами, а слопа станет еще больше.
Но таков путь.
@cgevent
🔥44😱9❤6😁3👍1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Работа по рассказу О Генри "Дары волхвов".
Автор: Алексей Чудинов.
А сегодняшняя Нейропрожарка будет в аккурат по мотивам предыдущего поста.
Я тут уже дискутирую с подписчиками по итогам этого лонгрида и консенсус такой - так же как в традиционных пайплайнах есть коммерческий софт, а есть инхаус разработки - в системах генерации контента будут коммерческие сервисы, а будут самописные боты, фреймворки, агенты - теперь любой креатор может завайбкодить себе пайплайн именно под свою задачу. Подписчик Алексей прислал мне результат такого написанного фреймворка для автогенерации еще в январе, но я был на каникулах и прошляпил. Исправляюсь.
Я сделал работу за четыре с половиной часа с помощью автогенерации (на моем агентском фреймворке) с минимальными ручными правками изображений. Озвучка добавлялась в ручном режиме. Фреймворк на вход получает описание текста (можно просто логлайн), необходимую длину видео, на выходе - сгенерированные видеокадры и таймлайн, который можно сразу импортировать в FinalCut или DaVinci (я использовал DaVinci).
Для генерации изображений использовалась NanoBanana Pro, для генерации видео использовалась MiniMax-Hailuo-02. Для фоновой музыки Suno, для tts - gpt-4o-mini-tts и фоновые звуки из библиотеки звуков.
@cgevent
Работа по рассказу О Генри "Дары волхвов".
Автор: Алексей Чудинов.
А сегодняшняя Нейропрожарка будет в аккурат по мотивам предыдущего поста.
Я тут уже дискутирую с подписчиками по итогам этого лонгрида и консенсус такой - так же как в традиционных пайплайнах есть коммерческий софт, а есть инхаус разработки - в системах генерации контента будут коммерческие сервисы, а будут самописные боты, фреймворки, агенты - теперь любой креатор может завайбкодить себе пайплайн именно под свою задачу. Подписчик Алексей прислал мне результат такого написанного фреймворка для автогенерации еще в январе, но я был на каникулах и прошляпил. Исправляюсь.
Я сделал работу за четыре с половиной часа с помощью автогенерации (на моем агентском фреймворке) с минимальными ручными правками изображений. Озвучка добавлялась в ручном режиме. Фреймворк на вход получает описание текста (можно просто логлайн), необходимую длину видео, на выходе - сгенерированные видеокадры и таймлайн, который можно сразу импортировать в FinalCut или DaVinci (я использовал DaVinci).
Для генерации изображений использовалась NanoBanana Pro, для генерации видео использовалась MiniMax-Hailuo-02. Для фоновой музыки Suno, для tts - gpt-4o-mini-tts и фоновые звуки из библиотеки звуков.
@cgevent
👎72😁13❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Молния! Igeogram 4 опенсорснулся!
По бенчам и аренам теперь это лучший опенсорсный генератор картинок.
"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"
Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)
Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.
Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.
Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.
Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.
Лицензия - некомерческая. Какая именно, надо разбирацца.
Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:
https://github.com/ideogram-oss/ideogram4
Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.
Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..
Всем бессонной ночи!
P.S. Editable text, movable layers, and full image editing are coming soon.
@cgevent
По бенчам и аренам теперь это лучший опенсорсный генератор картинок.
"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"
Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)
Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.
Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.
Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.
Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.
Лицензия - некомерческая. Какая именно, надо разбирацца.
Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:
https://github.com/ideogram-oss/ideogram4
Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.
Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..
Всем бессонной ночи!
P.S. Editable text, movable layers, and full image editing are coming soon.
@cgevent
🔥84❤18👎4😁4😱1
Reve 2.0
Если вы всю ночь тестировали опенсорсный Ideogram ибезуспешно ломали его цензуру (1), то днем вам не отоспаться - вышел новый Reve 2.0.
Упали, отжались и пошли тестировать.
Нативное 4K, сегментация объектов на картинке и, как следствие, более точное редактирование.
Времени нет, но вы держитесь.
https://app.reve.com/
@cgevent
Если вы всю ночь тестировали опенсорсный Ideogram и
Упали, отжались и пошли тестировать.
Нативное 4K, сегментация объектов на картинке и, как следствие, более точное редактирование.
Времени нет, но вы держитесь.
https://app.reve.com/
@cgevent
🔥46😁19❤7👍4👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Немного за Ideogram 4
1. Цензура вшита в веса модели. На реддите есть разные трюки для снижения порога срабатывания цензуры, это порой позволяет раскрыть тему сисек, но не полностью.
2. Все это не имеет никакого смысла, ибо в датасетах модели не было откровенного NSFW. Это все равно, что пытаться генерить порно с помощью Flux. Он что-то слышал и видел, но помнит плохо.
3. Весь NSFW всегда делался Лорами и Файнтюнами базовой модели. А не самой моделью. Поэтому отстаньте от Идеограма с сиськами и письками. Он если и сделает, то плохо. А вот вопрос тренировки лор и файнтюнов - открыт. Код для тренинга не опубликован. Острис уже начал эксперименты с Лорами - в частности с Лорой для понимания нормального языка, а не джейсона.
4. Судя по всему, подавляющее количество срабатываний цензуры (ложных в том числе) происходит при промптинге на обычном языке (это косяк Идеограмма). Он натренирован на JSON-разметке для картинок.
Чтобы как-то нивелировать эту проблему Комфи уже обновили дефолтный форкфлоу, а всемогущий Киджай час назад выкатил ноду Ideogram Prompt Buider - и там не только конвертация в джейсон, но и работа с layout боксами.
Забирать тут и смотреть на видео выше:
https://github.com/kijai/ComfyUI-KJNodes
https://github.com/kijai/ComfyUI-KJNodes/blob/main/nodes/ideogram4_nodes.py
5. Также есть кастомный форкфлоу от авторов Хромы: https://pastebin.com/xpYezwZp
@cgevent
1. Цензура вшита в веса модели. На реддите есть разные трюки для снижения порога срабатывания цензуры, это порой позволяет раскрыть тему сисек, но не полностью.
2. Все это не имеет никакого смысла, ибо в датасетах модели не было откровенного NSFW. Это все равно, что пытаться генерить порно с помощью Flux. Он что-то слышал и видел, но помнит плохо.
3. Весь NSFW всегда делался Лорами и Файнтюнами базовой модели. А не самой моделью. Поэтому отстаньте от Идеограма с сиськами и письками. Он если и сделает, то плохо. А вот вопрос тренировки лор и файнтюнов - открыт. Код для тренинга не опубликован. Острис уже начал эксперименты с Лорами - в частности с Лорой для понимания нормального языка, а не джейсона.
4. Судя по всему, подавляющее количество срабатываний цензуры (ложных в том числе) происходит при промптинге на обычном языке (это косяк Идеограмма). Он натренирован на JSON-разметке для картинок.
Чтобы как-то нивелировать эту проблему Комфи уже обновили дефолтный форкфлоу, а всемогущий Киджай час назад выкатил ноду Ideogram Prompt Buider - и там не только конвертация в джейсон, но и работа с layout боксами.
Забирать тут и смотреть на видео выше:
https://github.com/kijai/ComfyUI-KJNodes
https://github.com/kijai/ComfyUI-KJNodes/blob/main/nodes/ideogram4_nodes.py
5. Также есть кастомный форкфлоу от авторов Хромы: https://pastebin.com/xpYezwZp
@cgevent
❤18🔥13👍3
Forwarded from РассветAI
Так, Идеограм 4 локально в NSFW побеждён, воркфлоу в комментариях.
3🔥65😁15😱10👎6❤3
This media is not supported in your browser
VIEW IN TELEGRAM
Все-таки SAM 3D Body - это очень крутая технология.
На входе одно изображение, на выходе - болваны со скелетами, причем не как в примерах с танцами на камеру, а в произвольных позах.
Писал про это и тестировал тут:
https://t.iss.one/cgevent/14083
@cgevent
На входе одно изображение, на выходе - болваны со скелетами, причем не как в примерах с танцами на камеру, а в произвольных позах.
Писал про это и тестировал тут:
https://t.iss.one/cgevent/14083
@cgevent
🔥51👍11❤6😱2