Метаверсище и ИИще
51.4K subscribers
6.51K photos
5.32K videos
48 files
7.61K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
Вот тут примеры генераций из Dreamina Octo.

Тут важно заметить, что это не ручной генереж и монтаж, а результат работы агента. Который сам решил за ракурсы и склейки.
И за многое остальное.

Там есть и короткие ролики и пятиминутные фильмы.

Думаю, что скоро тикток просто захлебнется микродрамами, а слопа станет еще больше.

Но таков путь.

@cgevent
🔥44😱96😁3👍1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

Работа по рассказу О Генри "Дары волхвов".

Автор: Алексей Чудинов.

А сегодняшняя Нейропрожарка будет в аккурат по мотивам предыдущего поста.
Я тут уже дискутирую с подписчиками по итогам этого лонгрида и консенсус такой - так же как в традиционных пайплайнах есть коммерческий софт, а есть инхаус разработки - в системах генерации контента будут коммерческие сервисы, а будут самописные боты, фреймворки, агенты - теперь любой креатор может завайбкодить себе пайплайн именно под свою задачу. Подписчик Алексей прислал мне результат такого написанного
фреймворка для автогенерации еще в январе, но я был на каникулах и прошляпил. Исправляюсь.

Я сделал работу за четыре с половиной часа с помощью автогенерации (на моем агентском фреймворке) с минимальными ручными правками изображений. Озвучка добавлялась в ручном режиме. Фреймворк на вход получает описание текста (можно просто логлайн), необходимую длину видео, на выходе - сгенерированные видеокадры и таймлайн, который можно сразу импортировать в FinalCut или DaVinci (я использовал DaVinci).
Для генерации изображений использовалась NanoBanana Pro, для генерации видео использовалась MiniMax-Hailuo-02. Для фоновой музыки Suno, для tts - gpt-4o-mini-tts и фоновые звуки из библиотеки звуков.

@cgevent
👎72😁131
This media is not supported in your browser
VIEW IN TELEGRAM
Молния! Igeogram 4 опенсорснулся!

По бенчам и аренам теперь это лучший опенсорсный генератор картинок.

"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"

Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)

Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.

Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.


Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.

Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.

Лицензия - некомерческая. Какая именно, надо разбирацца.

Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:

https://github.com/ideogram-oss/ideogram4

Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.

Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..

Всем бессонной ночи!

P.S. Editable text, movable layers, and full image editing are coming soon.

@cgevent
🔥8418👎4😁4😱1
Reve 2.0

Если вы всю ночь тестировали опенсорсный Ideogram и безуспешно ломали его цензуру (1), то днем вам не отоспаться - вышел новый Reve 2.0.

Упали, отжались и пошли тестировать.

Нативное 4K, сегментация объектов на картинке и, как следствие, более точное редактирование.

Времени нет, но вы держитесь.

https://app.reve.com/

@cgevent
🔥46😁197👍4👎1
Ideogram покусал Krea

Они опенсорснут свою последнюю модель Krea K2.

@cgevent
😁44🔥13
This media is not supported in your browser
VIEW IN TELEGRAM
Немного за Ideogram 4

1. Цензура вшита в веса модели. На реддите есть разные трюки для снижения порога срабатывания цензуры, это порой позволяет раскрыть тему сисек, но не полностью.

2. Все это не имеет никакого смысла, ибо в датасетах модели не было откровенного NSFW. Это все равно, что пытаться генерить порно с помощью Flux. Он что-то слышал и видел, но помнит плохо.

3. Весь NSFW всегда делался Лорами и Файнтюнами базовой модели. А не самой моделью. Поэтому отстаньте от Идеограма с сиськами и письками. Он если и сделает, то плохо. А вот вопрос тренировки лор и файнтюнов - открыт. Код для тренинга не опубликован. Острис уже начал эксперименты с Лорами - в частности с Лорой для понимания нормального языка, а не джейсона.

4. Судя по всему, подавляющее количество срабатываний цензуры (ложных в том числе) происходит при промптинге на обычном языке (это косяк Идеограмма). Он натренирован на JSON-разметке для картинок.
Чтобы как-то нивелировать эту проблему Комфи уже обновили дефолтный форкфлоу, а всемогущий Киджай час назад выкатил ноду Ideogram Prompt Buider - и там не только конвертация в джейсон, но и работа с layout боксами.
Забирать тут и смотреть на видео выше:
https://github.com/kijai/ComfyUI-KJNodes
https://github.com/kijai/ComfyUI-KJNodes/blob/main/nodes/ideogram4_nodes.py

5. Также есть кастомный форкфлоу от авторов Хромы: https://pastebin.com/xpYezwZp

@cgevent
18🔥13👍3
Forwarded from РассветAI
Так, Идеограм 4 локально в NSFW побеждён, воркфлоу в комментариях.
3🔥65😁15😱10👎63
This media is not supported in your browser
VIEW IN TELEGRAM
Все-таки SAM 3D Body - это очень крутая технология.

На входе одно изображение, на выходе - болваны со скелетами, причем не как в примерах с танцами на камеру, а в произвольных позах.

Писал про это и тестировал тут:
https://t.iss.one/cgevent/14083

@cgevent
🔥51👍116😱2
This media is not supported in your browser
VIEW IN TELEGRAM
3Д-генераторы замахиваются на святое - органик моделинг, причем моделинг головы.

Это Rodin 2.5 - уже писал, что у них есть текстуры на 12К и генерация на 10 миллионов полигонов.

На входе - несколько картинок-ракурсов головы с разных углов (из генератора картинок или фото).

https://hyper3d.ai/

@cgevent
🔥54👍104
19 лучших Лор для LTX 2.3 в одном месте

С описаниями, видео-примерами и ссылками.

А то с ума можно сойти - про каждую постить отдельно.

https://www.stablediffusiontutorials.com/2026/05/ltx2.3-lora-models.html

@cgevent
😁107🔥3
Ну, за юристов.

Помните писал, что после поиска уязвимости в коде, ИИ может взяться искать (и находить) дыры в законах?

Также напомню, что кожаные уже давно не могут отличить живые фото\картинки от сгенеренных.

С юристами все еще хуже.

Кожаным гораздо больше нравится ИИ-юрист!

Прекрасный материал от Стэнфорда:
https://law.stanford.edu/press/ai-outperforms-law-professors-in-stanford-law-study/

Исследование, проведенное профессором юридической школы Стэнфорда Джулианом Ньярко, показывает, что преподаватели права в подавляющем большинстве случаев предпочитают ответы студентов, сгенерированные искусственным интеллектом, ответам, написанным их коллегами-преподавателями.

Исследование под названием «Преподаватели права предпочитают ИИ ответам коллег» было проведено с участием 16 преподавателей права из юридических школ США и проверяло, могут ли большие языковые модели служить эффективными учебными пособиями для курсов по договорному праву. В ходе слепой оценки почти 3000 анонимных сравнений преподаватели оценили ответы ИИ значительно выше, чем ответы, написанные другими преподавателями, при этом ИИ выиграл 75% сравнений.

У меня, наверное, все.

@cgevent
👍53😁17😱114
Media is too big
VIEW IN TELEGRAM
ИИ-синтезатор для Мака

Недавно постил про реалтаймовый генератор музыки как отдельного инструмента\трека с привязкой к хардверным клавишами на базе опенсорсного ACEStep1.5 (4090RTX)
https://t.iss.one/cgevent/15775

А щас вот Google бахнул аналогичный проект Magenta RealTime 2 - который работает исключительно на силиконовых Маках причем БЕЗ интернета.

"Наряду с моделью с открытыми весами мы выпускаем коллекцию инструментов и сценариев, созданных с помощью MRT2. Поэкспериментируйте с клонированием звуков, смешиванием жанров и созданием живого аккомпанемента с помощью этой музыкальной модели с низкой задержкой."

Маководы-меломаны - прочекайте проект:
https://magenta.withgoogle.com/mrt2

Выглядит довольно нарядно.

@cgevent
119🔥15😁1
Media is too big
VIEW IN TELEGRAM
Нейросторителлинг.

Вы находитесь тут.

Сорс: https://www.instagram.com/reels/DZOS1avIa4C/

Нас всех утянет в чорную дыру нейрослопа...

@cgevent
😁85👎33🔥20😱167👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Подписки на ИИ-сервисы из России стали намного доступнее

Если вы тоже не хотите ехать в соседнюю страну за банковской картой или постоянно просить друзей оплатить ваши подписки, то ваш идеальный вариант: виртуальная карта

Карты Mirocard созданы для оплаты зарубежных подписок и рекламы:

📱 ChatGPT, Gemini, Grok, Cursor, Kling, ElevenLabs и сотни других сервисов теперь можно оплачивать как обычной картой с платежной системой Visa или Mastercard.

А еще:
• Без платы ежемесячного обслуживания;
• Без скрытых комиссий;
• Возможность автоматического продления платежей;
• Мгновенное пополнение криптовалютой (принимаются разные коины)
• Открытие за несколько минут.

📱📱Подходит для оплаты Netflix, YouTube Premium и сотни других популярных сервисов.

Ребята дали ПРОМОКОД на бесплатное открытие карт Эстония: METAVERSE

(в личном кабинете выберите Доступные карты → Bin EE)

Открывайте карту в пару кликов, а с ней и более удобный способ оплаты любимых сервисов

@cgevent
Please open Telegram to view this post
VIEW IN TELEGRAM
👎37😁153👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Новые видео-модели.

На Artificial Analysis Arena появилась новая модель с кодовым названием Purple. А на arena.ai появился видеогенератор BOUNCYBOHR.

Если последнего спросить:
close-up cinematic scene from a film, professionally directed, focused, ultrafine details a woman laughs as she whiteboard writes out what model made this video

То он пишет VOYO-01.

Доверия к такому методу не очень много, поэтому народ продолжает гадать, кто из них Seedance 2.1

@cgevent
😁196😱4👍1👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Тренировка агентов и робатов в UE

Раньше такое делали в Юнити специально для автономных автомобилей.

Здесь идея расширена до любых автономных агентов обладающих "зрением" и "пониманием".

Это World-симулятор с открытым исходным кодом на базе Unreal Engine 5, предназначенный для обучения и тестирования агентов LLM и VLM в реалистичных 3D-средах.

Платформа поддерживает карты RGB, глубины и сегментации, а также навигацию, транспортные средства, пешеходов, робатов и процедурную генерацию городских ландшафтов.

Она построена на Gym-like Python interface и позволяет агентам ИИ обучаться физическому и социальному мышлению в сложных виртуальных мирах перед внедрением в реальный мир.

Опен сорс.

Полный код тут:
https://github.com/SimWorld-AI/SimWorld

@cgevent
🔥35😱175👍1👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Новый Grok косит под Gemini Omni

Виртуальные примерочные продолжают умирать пачками.

@cgevent
24👍15🔥4😁1