Forwarded from AI Product | Igor Akimov
MoneyPrinterTurbo - автоматическое создание роликов
Хах, а вот и защита - "принтер для денег" и бесплатный "контент-завод" :)
Опенсорсный проект, который собрал больше 77 тысяч звёзд на GitHub. Вводишь тему или короткий промпт – на выходе готовый ролик со сценарием, стоковым видео, озвучкой, субтитрами и музыкой.
– LLM пишет сценарий по твоей теме, либо можно подставить свой текст
– система сама подтягивает HD-сток без копирайта из Pexels и подобных источников
– TTS озвучивает текст, субтитры собираются автоматически
– сверху ложится фоновая музыка – и всё это рендерится в 1080p
Что под капотом
– локальные модели через Ollama (Llama, Mistral, Qwen) и облачные – OpenAI, DeepSeek, плюс Grok
– форматы 9:16, 16:9 и 1:1 – под Shorts, YouTube и Instagram сразу
– пакетная генерация: делаешь несколько вариантов и выбираешь лучший
– тонкая настройка субтитров: шрифт, размер, цвет, обводка, позиция
– есть и Web-интерфейс, и REST API, разворачивается через Docker
– внутри Python, MoviePy и FFmpeg, чистая MVC-архитектура
Прикольно, что проекту уже почти 2 года, а он все растет и растет. Качество упирается в стоковые видео плюс синтезированный голос, так что зрителю видно, что это конвейер – для брендового контента пока не годится. Зато как учебный кейс «склей AI-сервисы в продукт» и как фабрика для тестов каналов.
https://github.com/harry0703/MoneyPrinterTurbo/blob/main/README-en.md
Хах, а вот и защита - "принтер для денег" и бесплатный "контент-завод" :)
Опенсорсный проект, который собрал больше 77 тысяч звёзд на GitHub. Вводишь тему или короткий промпт – на выходе готовый ролик со сценарием, стоковым видео, озвучкой, субтитрами и музыкой.
– LLM пишет сценарий по твоей теме, либо можно подставить свой текст
– система сама подтягивает HD-сток без копирайта из Pexels и подобных источников
– TTS озвучивает текст, субтитры собираются автоматически
– сверху ложится фоновая музыка – и всё это рендерится в 1080p
Что под капотом
– локальные модели через Ollama (Llama, Mistral, Qwen) и облачные – OpenAI, DeepSeek, плюс Grok
– форматы 9:16, 16:9 и 1:1 – под Shorts, YouTube и Instagram сразу
– пакетная генерация: делаешь несколько вариантов и выбираешь лучший
– тонкая настройка субтитров: шрифт, размер, цвет, обводка, позиция
– есть и Web-интерфейс, и REST API, разворачивается через Docker
– внутри Python, MoviePy и FFmpeg, чистая MVC-архитектура
Прикольно, что проекту уже почти 2 года, а он все растет и растет. Качество упирается в стоковые видео плюс синтезированный голос, так что зрителю видно, что это конвейер – для брендового контента пока не годится. Зато как учебный кейс «склей AI-сервисы в продукт» и как фабрика для тестов каналов.
https://github.com/harry0703/MoneyPrinterTurbo/blob/main/README-en.md
GitHub
MoneyPrinterTurbo/README-en.md at main · harry0703/MoneyPrinterTurbo
利用 AI 大模型和自动化工作流,根据主题或关键词一键生成高清短视频。Generate HD short videos from a topic or keyword with an automated AI workflow. - harry0703/MoneyPrinterTurbo
❤28🔥12👎6👍4😱2
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Клип/фильм на авторскую песню.
Автор: Артем.
Здесь я в большинстве тестировал сиденс.
И он крут. Конечно не обошлось и без клинга, куда без него.
Что в итоге получилось.
Ушла полная максимальная подписка клинг.
И три максимальные подписки хигсфилд (на нем я использовал сиденс).
Озвучка и липсинк также сиденс.
Изображения банана и чуть чуть флакс 2 макс.
Ну и суно.
По работе около 100 часов.
Приятного просмотра 🫶
И спасибо за внимание!
@cgevent
Клип/фильм на авторскую песню.
Автор: Артем.
Здесь я в большинстве тестировал сиденс.
И он крут. Конечно не обошлось и без клинга, куда без него.
Что в итоге получилось.
Ушла полная максимальная подписка клинг.
И три максимальные подписки хигсфилд (на нем я использовал сиденс).
Озвучка и липсинк также сиденс.
Изображения банана и чуть чуть флакс 2 макс.
Ну и суно.
По работе около 100 часов.
О чем это видео.
Невероятная история большой войны.
Фрея - олицетворение искусственного интеллекта и человечности.
Магия любви и ненависти.
Мы расскажем как ведут себя Боги.
И как ведут себя люди, распоряжаясь своей волей.
Когда от одной маленькой жизни зависит судьба человечества.
Когда кажется, что выхода больше нет.
Она придет на помощь, чего бы это ни стоило.
Мы покажем ужасы войны и свет надежды.
Самая важная битва в которой решится все.
Это музыкальный клип? Короткометражный фильм?
Или нечто другое?
Смесь истории и фэнтези.
Авторская песня Артема Долгих.
В исполнении великолепной магической Фреи.
Своей магией она может превратить бездушную куклу в человека и подарить любовь - вы это видели.
Она может расколдовать животное, с помощью магии роз и подарить ему любовь - вы это видели.
Но если она придет в ярость, то сможет подарить только смерть - вы это увидите.
Добро пожаловать в иллюзию.
Добро пожаловать в реальность.
Приятного просмотра 🫶
И спасибо за внимание!
@cgevent
👎46🔥43👍19❤6😱6
Forwarded from Psy Eyes
Runway: убирают безлимитный тариф Unlimited и ставят вместо него за ту же цену ($95/мес) тариф Max.
В нем не будет режима Explore для безлимитной генерации видео и картинок в рамках подписки. Вместо 2250 кредитов в месяц даётся 9500, чего хватит на 15 FullHD видео Seedance 2 длиной 15 сек (цены). Неиспользованные кредиты переносятся на 1 следующий месяц, а дальше сгорают.
Для тех, кто уже на анлиме всё останется как есть до 31 августа. С 1 сентября, если вы на ежемесячном списании, либо остаётесь на Max, либо отменяете подписку. Если на ежегодном списании, с 1 сентября либо переходите на Max, либо получаете возврат средств за неиспользованное время.
Анонс в дискорде
В нем не будет режима Explore для безлимитной генерации видео и картинок в рамках подписки. Вместо 2250 кредитов в месяц даётся 9500, чего хватит на 15 FullHD видео Seedance 2 длиной 15 сек (цены). Неиспользованные кредиты переносятся на 1 следующий месяц, а дальше сгорают.
Для тех, кто уже на анлиме всё останется как есть до 31 августа. С 1 сентября, если вы на ежемесячном списании, либо остаётесь на Max, либо отменяете подписку. Если на ежегодном списании, с 1 сентября либо переходите на Max, либо получаете возврат средств за неиспользованное время.
Анонс в дискорде
👎39😁12😱6❤1
This media is not supported in your browser
VIEW IN TELEGRAM
AI-assisted retopology, UV unwrapping, GPU compute packing, and texture baking
Интересный новый софт Cozy Blanket - обещают ИИ-ретоп и Анврап.
Цен нет, доступа нет, сроков нет - но есть очень обещающие картинки и хорошо сделанный сайт.
Можно подписаться на обновления.
Подписался, заинтригован.
https://sparseal.com/cozyblanket-pro/
@cgevent
Интересный новый софт Cozy Blanket - обещают ИИ-ретоп и Анврап.
Цен нет, доступа нет, сроков нет - но есть очень обещающие картинки и хорошо сделанный сайт.
Можно подписаться на обновления.
Подписался, заинтригован.
https://sparseal.com/cozyblanket-pro/
@cgevent
🔥49😱8❤6
This media is not supported in your browser
VIEW IN TELEGRAM
Новые модели от Микрософта.
Они анонсировали семейство из семи новых моделей под брендом MAI для работы с изображениями, голосом и кодом.
MAI‑Thinking‑1 (ризонинг-модель, 35 миллиарда параметров, контект 128K)
MAI‑Code‑1-Flash
MAI‑Image‑2.5
MAI‑-Voice-2
Нас интересует (или не интересует) MAI‑Image‑2.5, которая на Арене взобралась на второе место в категории редактирования картинок, обойдя Банану. Что делает доверие к Арене еще более сомнительным.
С ценами на АПИ можно ознакомиться по ссылке, а но мне больше интересно, как Микрософт будет встраивать генерацию в продукты. Уже сейчас написано "MAI-Image-2.5 is live on PowerPoint for high-quality image generation and rolling out to OneDrive for precise editing."
@cgevent
Они анонсировали семейство из семи новых моделей под брендом MAI для работы с изображениями, голосом и кодом.
MAI‑Thinking‑1 (ризонинг-модель, 35 миллиарда параметров, контект 128K)
MAI‑Code‑1-Flash
MAI‑Image‑2.5
MAI‑-Voice-2
Нас интересует (или не интересует) MAI‑Image‑2.5, которая на Арене взобралась на второе место в категории редактирования картинок, обойдя Банану. Что делает доверие к Арене еще более сомнительным.
С ценами на АПИ можно ознакомиться по ссылке, а но мне больше интересно, как Микрософт будет встраивать генерацию в продукты. Уже сейчас написано "MAI-Image-2.5 is live on PowerPoint for high-quality image generation and rolling out to OneDrive for precise editing."
@cgevent
👍11❤7👎1🔥1
Forwarded from AI Product | Igor Akimov
This media is not supported in your browser
VIEW IN TELEGRAM
Codex теперь умеет выкладывать внутренние приложения
OpenAI зашёл на территорию Lovable и Replit, но пока только для внутренних сайтов.
Вчера на стриме «Intelligence at Work» OpenAI выкатил сразу три апдейта для Codex: шесть ролевых плагинов под бизнес-задачи, аннотации и – самое интересное – Sites.
Это плагин + managed-хостинг прямо внутри Codex. Просишь собрать приложение – Codex его строит, прогоняет, деплоит и возвращает ссылку, которую можно расшарить по воркспейсу. Весь цикл в одном треде, без ручной возни с инстансами и регионами (привет всем, кто пытался захостить локально собранное приложение в GCP или AWS).
Целятся во внутренние инструменты: онбординг-дашборды, базы знаний, борды для идей, репортинг-вью, лёгкие воркфлоу-приложения. То есть не «лендинг запилить», а «превратить рутину команды в живое приложение».
Добавили 2 фичи для хранения:
– D1 – SQLite-совместимая база под структурку: состояние чеклистов, закладки, фильтры, конфиги, метаданные файлов
– R2 – объектное хранилище под сами файлы: документы, картинки, ассеты
Любопытная деталь: D1 и R2 – это вообще-то названия продуктов Cloudflare. То есть «хостинг от OpenAI» под капотом едет на Cloudflare – OpenAI не строит инфру сам, а заворачивает чужую под свой бренд и свою авторизацию.
По дефолту приложение видят только владелец и админы воркспейса. Дальше открываешь либо на весь воркспейс (workspace_all), либо точечно на людей и группы (custom). Авторизация – через Sign in with ChatGPT. Пока превью для Business и Enterprise.
В общем, всем ChatGPT, пожираем всех ближайших конкурентов и GPT-врапперы.
https://developers.openai.com/codex/sites
OpenAI зашёл на территорию Lovable и Replit, но пока только для внутренних сайтов.
Вчера на стриме «Intelligence at Work» OpenAI выкатил сразу три апдейта для Codex: шесть ролевых плагинов под бизнес-задачи, аннотации и – самое интересное – Sites.
Это плагин + managed-хостинг прямо внутри Codex. Просишь собрать приложение – Codex его строит, прогоняет, деплоит и возвращает ссылку, которую можно расшарить по воркспейсу. Весь цикл в одном треде, без ручной возни с инстансами и регионами (привет всем, кто пытался захостить локально собранное приложение в GCP или AWS).
Целятся во внутренние инструменты: онбординг-дашборды, базы знаний, борды для идей, репортинг-вью, лёгкие воркфлоу-приложения. То есть не «лендинг запилить», а «превратить рутину команды в живое приложение».
Добавили 2 фичи для хранения:
– D1 – SQLite-совместимая база под структурку: состояние чеклистов, закладки, фильтры, конфиги, метаданные файлов
– R2 – объектное хранилище под сами файлы: документы, картинки, ассеты
Любопытная деталь: D1 и R2 – это вообще-то названия продуктов Cloudflare. То есть «хостинг от OpenAI» под капотом едет на Cloudflare – OpenAI не строит инфру сам, а заворачивает чужую под свой бренд и свою авторизацию.
По дефолту приложение видят только владелец и админы воркспейса. Дальше открываешь либо на весь воркспейс (workspace_all), либо точечно на людей и группы (custom). Авторизация – через Sign in with ChatGPT. Пока превью для Business и Enterprise.
В общем, всем ChatGPT, пожираем всех ближайших конкурентов и GPT-врапперы.
https://developers.openai.com/codex/sites
👍19❤8
This media is not supported in your browser
VIEW IN TELEGRAM
Вайб-контентинг или видео-агентинг.
Осьминог от Дримины.
Пока мы тут хлещемся по поводу того, какой видеогенератор круче, из тумана постепенно вырисовываются новые паплайны (спойлер - в пределе заветная кнопка "сделать красиво").
Я уже писал про Super Computer от Хиггсов - агент, который берет на вход минимальную хотелку пользователя, а дальше сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает.
Отзывы плохие - путается, застревает, жрет токены, ходит по кругу, генерит шнягу.
Также мы уже пообсуждали в коментах агента в Google Flow - отзывы получше, амбиции поменьше, функционал скромнее, но надежнее.
И это именно прототипы того, что нас ждет в контентинге в этом году.
Агент-партнер, которому можно либо отдать задачу и забыть, либо идти с ним вместе поэтапно. Самое главное, что он будет в контексте задачи - помнить про исходную хотелку, удерживать концепт персонажей, который сам же и породит, следить за консистентностью и даже соотносить финал с начальным замыслом.
Конечно, все это похоже на вайб-кодинг и удерживание контекcта в голове агента. Только контекст у нас визуальный, не всегда вербализуемый или объяснимый, но в целом замысел тот же.
Но если вайб-кодер часто вообще не смотрит код, а только юзает результат, ну или смотрит код - и для этого у него есть просто текстовый редактор кода. Но наш визуальный промежуточный код - это и текст, и картинки, и раскадровки, и звук, и концепты, и видосы референсы - в общем визуальная кустистая ботва, разбросанная по папкам и экрану.
И дальше будет очень интересно наблюдать, кто сможет организовать эту ботву (на экране) и интерактивное общение с агентом наиболее удобным образом.
Аналогов такого UX просто еще не было. Для раскадровок - одно, для концептов - мудборды, для персонажей - шиты, для композа - нодовый интерфейс, для монтажа - таймлайн. А тут надо как бы все вместе нарисовать на экране. Ибо теперь нажал кнопку - и все этапы могут сгенериться сами - и надо их как-то представить.
Пока все идет к тому, что это будет аналог нодовых интерсейсов на бесконечных холстах(канвасах), но не факт, что так и останется в будущем. Ноды - паллиатив.
Хех, это был дичайше долгая подводка к новому агенту от Дримины под названием OCTO.
И да, он тоже сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает. Под капотом может быть родной Сидэнс, но не обязательно, генератор картинок - любой, текстовые модели - любые.
https://dreamina.capcut.com/ai-tool/home/
На видео - примерный интерфейс, но я сейчас накидаю еще примеров того, что уже делается одной кнопкой в этом OCTO.
А чтобы еще больше удлинить пост и покрепче обосновать тезис про агентов и вайб-контентинг, приведу новость о том, что UTOPAI Studios выпустили вторую версию своего агентского пайплайна:
https://variety.com/2026/digital/tech/ai-utopai-studios-pai-2-generative-video-platform-1236764434/
И там прямо так и говорится:
“With PAI 2.0, our goal is to help catalyze a ‘Claude Code moment’ for media generation”
Тут они пытаются перетащить на себя общее одеяло, но в принципе да, мы сейчас наблюдаем ‘Claude Code moment’ для генерации контента, в виде прихода агентов в видеогенерацию.
@cgevent
Осьминог от Дримины.
Пока мы тут хлещемся по поводу того, какой видеогенератор круче, из тумана постепенно вырисовываются новые паплайны (спойлер - в пределе заветная кнопка "сделать красиво").
Я уже писал про Super Computer от Хиггсов - агент, который берет на вход минимальную хотелку пользователя, а дальше сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает.
Отзывы плохие - путается, застревает, жрет токены, ходит по кругу, генерит шнягу.
Также мы уже пообсуждали в коментах агента в Google Flow - отзывы получше, амбиции поменьше, функционал скромнее, но надежнее.
И это именно прототипы того, что нас ждет в контентинге в этом году.
Агент-партнер, которому можно либо отдать задачу и забыть, либо идти с ним вместе поэтапно. Самое главное, что он будет в контексте задачи - помнить про исходную хотелку, удерживать концепт персонажей, который сам же и породит, следить за консистентностью и даже соотносить финал с начальным замыслом.
Конечно, все это похоже на вайб-кодинг и удерживание контекcта в голове агента. Только контекст у нас визуальный, не всегда вербализуемый или объяснимый, но в целом замысел тот же.
Но если вайб-кодер часто вообще не смотрит код, а только юзает результат, ну или смотрит код - и для этого у него есть просто текстовый редактор кода. Но наш визуальный промежуточный код - это и текст, и картинки, и раскадровки, и звук, и концепты, и видосы референсы - в общем визуальная кустистая ботва, разбросанная по папкам и экрану.
И дальше будет очень интересно наблюдать, кто сможет организовать эту ботву (на экране) и интерактивное общение с агентом наиболее удобным образом.
Аналогов такого UX просто еще не было. Для раскадровок - одно, для концептов - мудборды, для персонажей - шиты, для композа - нодовый интерфейс, для монтажа - таймлайн. А тут надо как бы все вместе нарисовать на экране. Ибо теперь нажал кнопку - и все этапы могут сгенериться сами - и надо их как-то представить.
Пока все идет к тому, что это будет аналог нодовых интерсейсов на бесконечных холстах(канвасах), но не факт, что так и останется в будущем. Ноды - паллиатив.
Хех, это был дичайше долгая подводка к новому агенту от Дримины под названием OCTO.
И да, он тоже сам сценарит, концептит, персонажит, раскадрочит, промптит, итерирует, генерит, критикует сам себя, переделывает. Под капотом может быть родной Сидэнс, но не обязательно, генератор картинок - любой, текстовые модели - любые.
https://dreamina.capcut.com/ai-tool/home/
На видео - примерный интерфейс, но я сейчас накидаю еще примеров того, что уже делается одной кнопкой в этом OCTO.
А чтобы еще больше удлинить пост и покрепче обосновать тезис про агентов и вайб-контентинг, приведу новость о том, что UTOPAI Studios выпустили вторую версию своего агентского пайплайна:
https://variety.com/2026/digital/tech/ai-utopai-studios-pai-2-generative-video-platform-1236764434/
И там прямо так и говорится:
“With PAI 2.0, our goal is to help catalyze a ‘Claude Code moment’ for media generation”
Тут они пытаются перетащить на себя общее одеяло, но в принципе да, мы сейчас наблюдаем ‘Claude Code moment’ для генерации контента, в виде прихода агентов в видеогенерацию.
@cgevent
👍20❤12🔥4👎1
Вот тут примеры генераций из Dreamina Octo.
Тут важно заметить, что это не ручной генереж и монтаж, а результат работы агента. Который сам решил за ракурсы и склейки.
И за многое остальное.
Там есть и короткие ролики и пятиминутные фильмы.
Думаю, что скоро тикток просто захлебнется микродрамами, а слопа станет еще больше.
Но таков путь.
@cgevent
Тут важно заметить, что это не ручной генереж и монтаж, а результат работы агента. Который сам решил за ракурсы и склейки.
И за многое остальное.
Там есть и короткие ролики и пятиминутные фильмы.
Думаю, что скоро тикток просто захлебнется микродрамами, а слопа станет еще больше.
Но таков путь.
@cgevent
🔥44😱9❤6😁3👍1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Работа по рассказу О Генри "Дары волхвов".
Автор: Алексей Чудинов.
А сегодняшняя Нейропрожарка будет в аккурат по мотивам предыдущего поста.
Я тут уже дискутирую с подписчиками по итогам этого лонгрида и консенсус такой - так же как в традиционных пайплайнах есть коммерческий софт, а есть инхаус разработки - в системах генерации контента будут коммерческие сервисы, а будут самописные боты, фреймворки, агенты - теперь любой креатор может завайбкодить себе пайплайн именно под свою задачу. Подписчик Алексей прислал мне результат такого написанного фреймворка для автогенерации еще в январе, но я был на каникулах и прошляпил. Исправляюсь.
Я сделал работу за четыре с половиной часа с помощью автогенерации (на моем агентском фреймворке) с минимальными ручными правками изображений. Озвучка добавлялась в ручном режиме. Фреймворк на вход получает описание текста (можно просто логлайн), необходимую длину видео, на выходе - сгенерированные видеокадры и таймлайн, который можно сразу импортировать в FinalCut или DaVinci (я использовал DaVinci).
Для генерации изображений использовалась NanoBanana Pro, для генерации видео использовалась MiniMax-Hailuo-02. Для фоновой музыки Suno, для tts - gpt-4o-mini-tts и фоновые звуки из библиотеки звуков.
@cgevent
Работа по рассказу О Генри "Дары волхвов".
Автор: Алексей Чудинов.
А сегодняшняя Нейропрожарка будет в аккурат по мотивам предыдущего поста.
Я тут уже дискутирую с подписчиками по итогам этого лонгрида и консенсус такой - так же как в традиционных пайплайнах есть коммерческий софт, а есть инхаус разработки - в системах генерации контента будут коммерческие сервисы, а будут самописные боты, фреймворки, агенты - теперь любой креатор может завайбкодить себе пайплайн именно под свою задачу. Подписчик Алексей прислал мне результат такого написанного фреймворка для автогенерации еще в январе, но я был на каникулах и прошляпил. Исправляюсь.
Я сделал работу за четыре с половиной часа с помощью автогенерации (на моем агентском фреймворке) с минимальными ручными правками изображений. Озвучка добавлялась в ручном режиме. Фреймворк на вход получает описание текста (можно просто логлайн), необходимую длину видео, на выходе - сгенерированные видеокадры и таймлайн, который можно сразу импортировать в FinalCut или DaVinci (я использовал DaVinci).
Для генерации изображений использовалась NanoBanana Pro, для генерации видео использовалась MiniMax-Hailuo-02. Для фоновой музыки Suno, для tts - gpt-4o-mini-tts и фоновые звуки из библиотеки звуков.
@cgevent
👎72😁13❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Молния! Igeogram 4 опенсорснулся!
По бенчам и аренам теперь это лучший опенсорсный генератор картинок.
"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"
Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)
Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.
Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.
Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.
Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.
Лицензия - некомерческая. Какая именно, надо разбирацца.
Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:
https://github.com/ideogram-oss/ideogram4
Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.
Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..
Всем бессонной ночи!
P.S. Editable text, movable layers, and full image editing are coming soon.
@cgevent
По бенчам и аренам теперь это лучший опенсорсный генератор картинок.
"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"
Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)
Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.
Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.
Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.
Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.
Лицензия - некомерческая. Какая именно, надо разбирацца.
Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:
https://github.com/ideogram-oss/ideogram4
Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.
Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..
Всем бессонной ночи!
P.S. Editable text, movable layers, and full image editing are coming soon.
@cgevent
🔥84❤18👎4😁4😱1
Reve 2.0
Если вы всю ночь тестировали опенсорсный Ideogram ибезуспешно ломали его цензуру (1), то днем вам не отоспаться - вышел новый Reve 2.0.
Упали, отжались и пошли тестировать.
Нативное 4K, сегментация объектов на картинке и, как следствие, более точное редактирование.
Времени нет, но вы держитесь.
https://app.reve.com/
@cgevent
Если вы всю ночь тестировали опенсорсный Ideogram и
Упали, отжались и пошли тестировать.
Нативное 4K, сегментация объектов на картинке и, как следствие, более точное редактирование.
Времени нет, но вы держитесь.
https://app.reve.com/
@cgevent
🔥46😁19❤7👍4👎1