Метаверсище и ИИще
51.4K subscribers
6.51K photos
5.32K videos
48 files
7.61K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
Forwarded from Сиолошная
Google проводят ежегодный I/O, на котором показали Gemini Omni Flash (про неё отдельно), и Gemini Flash 3.5 — новый флагман компании. Почти как Gemini Pro 3.1 (во многом лучше по метрикам, но нужно смотреть в практике), но существенно быстрее и немного дешевле Pro (но гораздо дороже прошлых Flash).

На новых чипах TPU v8i скорость вообще была 800-1500 токенов в секунду, но пока видимо не доступно. Хотя упомянули, что в Antigravity скорость в 12 раз быстрее, чем прошлая Pro.

Ждём Pro (не сегодня) — обещали в следующем месяце.
18👍5👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni - редактирующая модель

Результат предыдущих генераций можно редактировать промптом.

Предыдущий промт учитывается - консистентность должна сохраняться.

@cgevent
😁3115😱8🔥6
У меня в приложении Google Flow появилась Gemini Omni для генерации видео.

Одно видео - 30 кредитов.
За 10 секунд.

На плане Pro дают 1000 кредитов в месяц. Итого 33 видео.

При этом Veo 3.1 Quality стоит 100 кредитов за одно видео.

https://support.google.com/googleone/answer/16287445

@cgevent
1😱32🔥179
Forwarded from Ai molodca (Dobrokotov)
Собрал выжимку (с помощью ГПТ, хехе) всего самого интересного из презентации гугла в карточке.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥50👍9👎72
This media is not supported in your browser
VIEW IN TELEGRAM
Штош, поразбираемся с Gemini Omni. Генерация

По сравнению с Seedance первое, что бросается в глаза это вялая динамика и физика.
Качество картинки в принципе ок, нет особого мыла. Но по сравнению с Сиданским все выглядит заторможенно и как-то искусственно. Переключения камеры, скажем так, своеобразны.
10 секунд также не радуют.
Но перейдем к редактированию.

@cgevent
😁786👍5👎1🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. Редактирование

А вот редактирование видео совершенно огненное. Причем вы можете загружать свое видео, а не обязательно генерацию.

"Make everyone in this shot flamingos. Wearing the same outfit."

@cgevent
🔥101👍5
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. Редактирование

Еще три примера редактирования от fofr.

1. исходник
2. сделай её невидимой, надень на неё перчатки
3. пока она говорит, подходят двое мужчин и уносят фотографию в рамке
4. поменяй ее одежду

Ну то есть можно рассматривать Gemini Omni как Нанобанану только для видео. Понимание происходящего в кадре потрясающее, возможности редактирования тоже.

За сим вырисовывается такой пайплайн: генерация в Сиденс, редактирование в Омни.

Да, дороговато получается.

@cgevent
🔥805👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. World Knowledge

Также надо понимать, что Omni реально мультимодальная и у нее под капотом вся мощь Gemini. Ну то есть она понимает про окружающий мир и его устройство все, что есть в мозгах у LLM. Также как и Нанобанана.

Ей, по идее, не нужны дико детальные промпты, она способна создавать детали на основе понимания мира.
Есть масса применений за пределами драк и бешеной динамики (образование, иллюстрация, презентации), где такое понимание будет сильно полезным.

@cgevent
2🔥51👍76
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. Редактирование реальных видео

Это, конечно, совершенно убойный пример.
Я тут собрался накатить за композ, но понял, что это это уже какой-то мета-композ, который обычными средствами просто не сделать.

Исходник - реальное youtube-видео с Gemini Omni Release Notes:
https://youtu.be/5T0yRNmNRi4
(всем рекомендую)

Результат - в посте.

Кстати, со всеми этими генерациями, я понял, что постоянно оцениваю липсинк - даже на реальных видео!

@cgevent
🔥80😱15😁125👍5
Forwarded from Сиолошная
Sama пришёл в свою альма-матер YC и предложил всем стартапам по $2M в токенах (то есть можно и на Codex и на API тратить) за какой-то процент от компании.

К сожалению, не могу найти, какой % от компании, но очень интересно, сколько фаундеров примут предложение — токены они получают сейчас, а акции ещё когда что-то стоить начнут? Не скоро.

Интересно, как изменится относительная популярность Claude Code в ближайшее время 😏
Please open Telegram to view this post
VIEW IN TELEGRAM
1👎14😁12🔥5👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni. Avatar\Cameo

Взял свою старую фотку с CG EVENT 2015 (примечательно, что в тех самых очках Google Glass) и попросил превратить меня в жидкого терминатора.

Скушал и не поперхнулся.

Конечно сохранить identity с ракурса под 45 градусов нереально, но он, как смог, справился.

"Transform foto of me to the video of liquid terminator looking at camera and saying "Metaverse is coming!". Make transition into terminator smooth"

Он воспринял transition слишком буквально и поменял задник. В следующем посте попросил его не менять фон.

@cgevent
👍32😁71👎1
Gemini Omni. Avatar\Cameo

Кушает фото в лучшем видео.

Правда детали на терминаторе скачут: очки пропадают, борода тоже.

Но возможно не стоит увлекаться жидкими формами.

Промпт в предыдущем посте.

@cgevent
🔥3712👎6😁6
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

«Новая жизнь»

Автор: Курмаев Тимур (@welcomehomeson)

Я иногда тестирую ИИ инструменты для создания видео и фото - просто для развлечения. И в качестве бенчмарка я всегда использую нашу кошку - самую достойную модель для моих экспериментов.

Перед отпуском решил взять подписку Higgsfield, хотел сделать небольшую, но цельную работу - проверить можно ли без опыта в производстве видео-контента выдать удобоваримый результат и за недорого.

- Сценарий: из головы. Сейчас мы ждем пополнение в семье, и я придумал простенький сюжет о том как меняется жизнь кошек с появлением ребенка. В главной роли мой бенчмарк, конечно же.

- Стилистика: хотелось повторить анимацию из мультфильмов Аркейн и Человек-Паук: Через вселенные (получилось далеко не везде)

- Инструменты пробовал разные, но лучший эффект дала связка:
• Gemini для промптов (дал лучшее описание специфической анимации)
• NanaBanana 2/Pro для генерации кадров
• Kling 3.0 для анимации через старт/стоп кадры, с использованием функции Elements.
• CapCut для монтажа и звуков
• Музыку хотел нагенерить в Suno после черновой версии, но в итоге остановился на «затычке» из CapCut и известном треке
• Генерировал в 720 (экономия!), затем апскейлил через десктопный Topaz.

Проблема, которая бесила больше всего - консистентность. Из-за нее я раньше не пытался делать что-то связное. Сейчас я был нацелен на функцию Elements в Kling. Также ради консистентности сделал выбор в пользу fixed frame. Даже при этих условиях пришлось пойти на допущения (я думаю, что они будут сразу заметны). Уверен, что это решается большим количеством попыток генераций = бюджетом.

Если выделить чистое время работы - наберется порядка 10 часов.

Пользовался только Higgsfield по подписке. На видео израсходовал примерно 2200-2400 рублей.

Выводы обывателя: ИИ-инструменты выдают хорошие результаты, но итоговое качество финального ролика - вопрос бюджета и времени. Как инструмент для продакшена - топ, для личных целей - пока еще слишком нестабильно и дорого.

@cgevent
👍42👎27😁22
Text-to-CAD

Но теперь с помощью агентов.

Агент в цикле генерит модель, делает подрендер, оценивает качество, редактирует исходник и тд.

Набор скиллов для Codex, Claude Code и других агентов, позволяющий генерить замысловатые CAD-модели.
Есть экспорт в STEP, STL, 3MF, DXF, GLB.
Есть URDF/SRDF/SDF robot descriptions
Может работать локально.

Код открыт:
https://github.com/earthtojake/text-to-cad
Демо:
https://demo.cadskills.xyz/?file=fun%2Frobotic_hand_end_effector.step (без генерации)

Сайт с описанием: https://www.cadskills.xyz/

@cgevent
🔥495👍5👎1
Gemini Omni. Что дальше?

Я послушал подкаст Introducing Gemini Omni:
https://youtu.be/5T0yRNmNRi4?t=844

И там есть пара интересных моментов о том, что выпущенная модель Gemini Omni имеет приставку Flash.
И что это как бы первая и "маленькая" модель. И что это можно сравнить с первой Нанабананой.
И что скоро нас ждем модель Pro (по аналогии с Нанабанана Про, появившейся позже и ставшей практически стандартом для редактирования изображений.

В подкасте достаточно много и откровенно говорили про ограничение в 10 секунд.
Во-первых, уже сейчас можно продолжать клипы, ибо Омни держит в памяти полный рефренс и по идее должна попадать в косистентность.
Во-вторых, и это главное, несколько раз сказали, что длительность будет увеличена в следующей версии. Несколько раз звучала цифра в 30 секунд, но скорее как вариант, а не окончательный параметр.

Из интересного: когда вы подсовываете свое (чужое) лицо как референс, имеет смысл делать как можно больше фоток с разных ракурсов и подсовывать их все. Оказывается модель строит что-то типа 3Д-модели (как при фотограмметрии), чтобы сохранять консистентность при повороте головы. Больше фоток на входе - лучше.

Более того, в будущих версиях может появиться версия с видео-референсом вашего лица. Ставите камеру и крутите лицом перед ней (по типу KYC) - модель строит модель вашего лица и использует ее при генерации.

И все это может превратиться в создание ваше цифровой копии - ваш аватар на максималках. Вы записываете видео, где крутите башкой и зачитываете текст на камеру. Цифруется лицо и голос, и сохраняется в виде вашего аватара, который вы в дальнейшем можете использовать в генерациях. (Тут HeyGen поперхнулся)

Также рассказали, что в новых версиях Omni появится больше tooling-a - инструментов, унаследованных от Gemini, типа поиска в интернете и работы с данными. То, что появилось в Nanobanana 2.

Про инструменты для сторителлинга сказали, но вкратце. Будут развивать Flow в этом направлении.

@cgevent
👍20🔥1413👎1
Mira — топ-1 AI-агент в Telegram 💫

Крутейшая альтернатива OpenClaw, которая работает из коробки в один клик.
Cаб-агенты, 1000+ MCP, работа в групповых чатах.

Через Mira можно автоматизировать:

🔄 ремайндеры и автономные задачи
📈 трейдинг и мониторинг
🤖 AI-ботов и агентов
✍️ генерацию и автопостинг контента
📊 Gmail, Calendar, Notion, GitHub и другие сервисы

Без настройки серверов, API и сложного сетапа.
Please open Telegram to view this post
VIEW IN TELEGRAM
👎67😁16👍53🔥2😱2
Media is too big
VIEW IN TELEGRAM
3Д-генераторы замахиваются на волосы, вены и бороды.

В режиме Extreme High генератор Rodin 2.5 генерит довольно реалистичные анатомические подробности. Брови и волосы уже не выглядят кашей.
Напомню, что Rodin умеет генерить 10 миллионов полигонов.

Ну и они не боятся генерить органику теперь.

Правда что делать с такой оравой фейсов непонятно - разве что в 3Д-печать.

https://hyper3d.ai/

@cgevent
21👍11
3Д-генератор от Apple

Не уверен, что после Хуньяня, кто-то захочет им пользоваться, но оставлю тут для истории.
Они прям с нуля сделали свой 3Д-генератор по одной картинке с упором на то, что освещение с разных ракурсов помогает им восстанавливать более точную форму объекта.
Сравнивают результата с первым TRILLIS (что странно).
Пространственного разрешения, как по мне, им явно не хватает.

Зато есть код и веса:
https://github.com/apple/ml-lito
https://apple.github.io/ml-lito/

@cgevent
👍11😁6😱21🔥1