Метаверсище и ИИще
51.4K subscribers
6.51K photos
5.32K videos
48 files
7.61K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
Скоро выйдут Seedance 2.1 и Seedance 2.0 Mini

- По имеющимся данным, Seedance 2.1 обеспечивает повышение качества генерации примерно на 20% по сравнению с Seedance 2.0.

- Seedance 2.0 Mini, представляет собой облегченную версию, которая работает лучше, чем Seedance 2.0 Fast, при ожидаемой цене около 0.073 доллара за секунду.

@cgevent
🔥47😱103🙏3👍2
Импортозамещение, которое переросло в AI-native.

Сбер разрабатывает собственную ERP-платформу и планирует выкатить её на рынок в 2027 году. Проект пилят уже около трех лет, масштаб сопоставим с внедрением SAP.

В основу заложили микросервисы и ИИ-помощника ГигаЧат, чтобы защититься от внешних рисков. По сути, это основа для автономного бизнеса, где приложения сами анализируют контекст и запускают действия.

Зампред правления и финдиректор Сбера Тарас Скворцов отмечает, что компания отказалась от идеи делать «SAP 2.0». Нужен единый продукт полного цикла, а не разрозненные софтины.

Внутри банка первые массовые операции пойдут в пром в январе 2027 года. Система будет сама рулить финансами, закупками и логистикой через цифровых ИИ-агентов.

Осталось дождаться релиза и посмотреть, как это взлетит.

https://www.cnews.ru/news/line/2026-05-19_sberbank_sozdaet_erp_budushchego

@cgevent
👎57😁30👍93🔥2
Media is too big
VIEW IN TELEGRAM
Генерация произвольных действий в режиме реального времени с помощью голосовых команд

Здесь примечательно то, что робат не выполняет никаких предзаписанных действий типа танцев с бубнами на сцене.

С помощью внешних голосовых команд Unitree G1 напрямую выполняет широкий спектр действий в режиме реального времени. Ну то есть он сначала "думает" о том, что его просят, а потом превращает это в последовательность движений. И это не "Алиса, включи музику", а довольно нетривиальные команды.
Интересно наблюдать, как после голосовой команды он такой: "минутчку, мне надо подумать"...

Видео было снято одним дублем с записью звука на месте.

Команды на китайском, но внизу есть титры с расшифровкой.

@cgevent
🔥32😱42👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Камео в Gemini Omni?

Логан Килпатрик, Member of technical staff в Google, тизерит видео с собой в твитторе.
В конце многозначительно произносит "Gemini" (не Veo).

Что наводит нас на мысль, что это генерация в новой модели Gemini Omni, которая как бы "включает" в себя новую Veo. То есть будет полностью мультимодальной (как Нанабанана).

Длительность видео - 8 секунд - это настораживает.

Но сходство - стопроцентное. Означает ли это, что Гугл пойдет по пути Sora и сделает функцию типа Cameo или Likeness, для того, чтобы генерить реальных людей.

Зная Гугл, система подверждения личности для таких генераций должна быть дико строгой.

Впрочем осталось подождать немного, Google I\O уже совсем скоро.

@cgevent
👍265👎2
This media is not supported in your browser
VIEW IN TELEGRAM
Там 3D-генератор Rodin обновился до версии 2.5

Теперь он умеет генерить 10 МИЛЛИОНОВ ПОЛИГОНОВ.

Не уверен, что это главная метрика для генераторов, но размах впечатляет.

Там много и других ништяков и конечно Thinking Mode.

Надо тестировать..

https://hyper3d.ai/

@cgevent
37🔥4
Forwarded from Сиолошная
Google проводят ежегодный I/O, на котором показали Gemini Omni Flash (про неё отдельно), и Gemini Flash 3.5 — новый флагман компании. Почти как Gemini Pro 3.1 (во многом лучше по метрикам, но нужно смотреть в практике), но существенно быстрее и немного дешевле Pro (но гораздо дороже прошлых Flash).

На новых чипах TPU v8i скорость вообще была 800-1500 токенов в секунду, но пока видимо не доступно. Хотя упомянули, что в Antigravity скорость в 12 раз быстрее, чем прошлая Pro.

Ждём Pro (не сегодня) — обещали в следующем месяце.
18👍5👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni - редактирующая модель

Результат предыдущих генераций можно редактировать промптом.

Предыдущий промт учитывается - консистентность должна сохраняться.

@cgevent
😁3115😱8🔥6
У меня в приложении Google Flow появилась Gemini Omni для генерации видео.

Одно видео - 30 кредитов.
За 10 секунд.

На плане Pro дают 1000 кредитов в месяц. Итого 33 видео.

При этом Veo 3.1 Quality стоит 100 кредитов за одно видео.

https://support.google.com/googleone/answer/16287445

@cgevent
1😱32🔥179
Forwarded from Ai molodca (Dobrokotov)
Собрал выжимку (с помощью ГПТ, хехе) всего самого интересного из презентации гугла в карточке.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥50👍9👎72
This media is not supported in your browser
VIEW IN TELEGRAM
Штош, поразбираемся с Gemini Omni. Генерация

По сравнению с Seedance первое, что бросается в глаза это вялая динамика и физика.
Качество картинки в принципе ок, нет особого мыла. Но по сравнению с Сиданским все выглядит заторможенно и как-то искусственно. Переключения камеры, скажем так, своеобразны.
10 секунд также не радуют.
Но перейдем к редактированию.

@cgevent
😁786👍5👎1🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. Редактирование

А вот редактирование видео совершенно огненное. Причем вы можете загружать свое видео, а не обязательно генерацию.

"Make everyone in this shot flamingos. Wearing the same outfit."

@cgevent
🔥101👍5
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. Редактирование

Еще три примера редактирования от fofr.

1. исходник
2. сделай её невидимой, надень на неё перчатки
3. пока она говорит, подходят двое мужчин и уносят фотографию в рамке
4. поменяй ее одежду

Ну то есть можно рассматривать Gemini Omni как Нанобанану только для видео. Понимание происходящего в кадре потрясающее, возможности редактирования тоже.

За сим вырисовывается такой пайплайн: генерация в Сиденс, редактирование в Омни.

Да, дороговато получается.

@cgevent
🔥805👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. World Knowledge

Также надо понимать, что Omni реально мультимодальная и у нее под капотом вся мощь Gemini. Ну то есть она понимает про окружающий мир и его устройство все, что есть в мозгах у LLM. Также как и Нанобанана.

Ей, по идее, не нужны дико детальные промпты, она способна создавать детали на основе понимания мира.
Есть масса применений за пределами драк и бешеной динамики (образование, иллюстрация, презентации), где такое понимание будет сильно полезным.

@cgevent
2🔥51👍76
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. Редактирование реальных видео

Это, конечно, совершенно убойный пример.
Я тут собрался накатить за композ, но понял, что это это уже какой-то мета-композ, который обычными средствами просто не сделать.

Исходник - реальное youtube-видео с Gemini Omni Release Notes:
https://youtu.be/5T0yRNmNRi4
(всем рекомендую)

Результат - в посте.

Кстати, со всеми этими генерациями, я понял, что постоянно оцениваю липсинк - даже на реальных видео!

@cgevent
🔥80😱15😁125👍5
Forwarded from Сиолошная
Sama пришёл в свою альма-матер YC и предложил всем стартапам по $2M в токенах (то есть можно и на Codex и на API тратить) за какой-то процент от компании.

К сожалению, не могу найти, какой % от компании, но очень интересно, сколько фаундеров примут предложение — токены они получают сейчас, а акции ещё когда что-то стоить начнут? Не скоро.

Интересно, как изменится относительная популярность Claude Code в ближайшее время 😏
Please open Telegram to view this post
VIEW IN TELEGRAM
1👎14😁12🔥5👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. Avatar\Cameo

Взял свою старую фотку с CG EVENT 2015 (примечательно, что в тех самых очках Google Glass) и попросил превратить меня в жидкого терминатора.

Скушал и не поперхнулся.

Конечно сохранить identity с ракурса под 45 градусов нереально, но он, как смог, справился.

"Transform foto of me to the video of liquid terminator looking at camera and saying "Metaverse is coming!". Make transition into terminator smooth"

Он воспринял transition слишком буквально и поменял задник. В следующем посте попросил его не менять фон.

@cgevent
👍32😁71👎1
Gemini Omni. Avatar\Cameo

Кушает фото в лучшем видео.

Правда детали на терминаторе скачут: очки пропадают, борода тоже.

Но возможно не стоит увлекаться жидкими формами.

Промпт в предыдущем посте.

@cgevent
🔥3712👎6😁6
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

«Новая жизнь»

Автор: Курмаев Тимур (@welcomehomeson)

Я иногда тестирую ИИ инструменты для создания видео и фото - просто для развлечения. И в качестве бенчмарка я всегда использую нашу кошку - самую достойную модель для моих экспериментов.

Перед отпуском решил взять подписку Higgsfield, хотел сделать небольшую, но цельную работу - проверить можно ли без опыта в производстве видео-контента выдать удобоваримый результат и за недорого.

- Сценарий: из головы. Сейчас мы ждем пополнение в семье, и я придумал простенький сюжет о том как меняется жизнь кошек с появлением ребенка. В главной роли мой бенчмарк, конечно же.

- Стилистика: хотелось повторить анимацию из мультфильмов Аркейн и Человек-Паук: Через вселенные (получилось далеко не везде)

- Инструменты пробовал разные, но лучший эффект дала связка:
• Gemini для промптов (дал лучшее описание специфической анимации)
• NanaBanana 2/Pro для генерации кадров
• Kling 3.0 для анимации через старт/стоп кадры, с использованием функции Elements.
• CapCut для монтажа и звуков
• Музыку хотел нагенерить в Suno после черновой версии, но в итоге остановился на «затычке» из CapCut и известном треке
• Генерировал в 720 (экономия!), затем апскейлил через десктопный Topaz.

Проблема, которая бесила больше всего - консистентность. Из-за нее я раньше не пытался делать что-то связное. Сейчас я был нацелен на функцию Elements в Kling. Также ради консистентности сделал выбор в пользу fixed frame. Даже при этих условиях пришлось пойти на допущения (я думаю, что они будут сразу заметны). Уверен, что это решается большим количеством попыток генераций = бюджетом.

Если выделить чистое время работы - наберется порядка 10 часов.

Пользовался только Higgsfield по подписке. На видео израсходовал примерно 2200-2400 рублей.

Выводы обывателя: ИИ-инструменты выдают хорошие результаты, но итоговое качество финального ролика - вопрос бюджета и времени. Как инструмент для продакшена - топ, для личных целей - пока еще слишком нестабильно и дорого.

@cgevent
👍42👎27😁22
Text-to-CAD

Но теперь с помощью агентов.

Агент в цикле генерит модель, делает подрендер, оценивает качество, редактирует исходник и тд.

Набор скиллов для Codex, Claude Code и других агентов, позволяющий генерить замысловатые CAD-модели.
Есть экспорт в STEP, STL, 3MF, DXF, GLB.
Есть URDF/SRDF/SDF robot descriptions
Может работать локально.

Код открыт:
https://github.com/earthtojake/text-to-cad
Демо:
https://demo.cadskills.xyz/?file=fun%2Frobotic_hand_end_effector.step (без генерации)

Сайт с описанием: https://www.cadskills.xyz/

@cgevent
🔥495👍5👎1