Метаверсище и ИИще
51.4K subscribers
6.51K photos
5.32K videos
48 files
7.61K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
Тут твитторчанский просто исприподвзрывается новостью, от том, что теперь вы можете покупать крипту прямо в chatGPT.

Попробуйте в поиске "MoonPay is now live on ChatGPT".

Уже целый статьи написаны, о том какой это прорыв. И что Moonpay совершает революцию.

Короче, чтобы понять, что происходит, достаточно найти в chatGPT AppStore это несчастное приложение и посмотреть на скрин. Вот оно:
https://chatgpt.com/apps/moonpay/asdk_app_6a07aa9c220c8191bbdefade1b2629fc

Из него следует, что кинув промпт "хачу купить битка на 1 доллар" пользователь получает прямую ссылку на moonpay. Кликнув по которой он покидает chatGPT навсегда.

Более того, если попытаться установить его, оно вам расскажет, про все, что связано с платежами, кошельками, юрисдикциями и KYC будет происходить на стороне moonpay.

Ситуация с AppStore по-прежнему напоминает мне ситуацию с плагинами для chatGPT: все подряд используют каталог для рекламы своих сервисов и увода трафика на свои сайты.

Moonpay хорошо пропиарился на лого OpenAI - всесь твиттор забит этой новостью.

В общем, нет, вы не можете ничего оплатить криптой внутри chatGPT.

@cgevent
😁254🔥4
Нейрорендер и нейрокомпоз в Gemini Omni

Собрал пару примеров, которые меня сильно впечатляют.

С кувшином - это настольно просто и элегантно, что видится этакий редактор шейдеров, который можно набрасывать на выбранные объекты и получать лукдев для готового материала. Прозрачный шейдер доставляет особо.

С медведем - это прям метакомпоз. И ведь пыль летит как надо и фон вроде не плывет.

Но с поездом - это прям вишенка. Поглядите до конца, он длинный. Сороконожка прекрасна, конечно.

Композ не будет прежним.

@cgevent
🔥6815👍5😱4😁3👎1
House of David - ИИ-инструменты.

Я помню еще на семинарах в матвеевском были холивары - "а это был в максе сделано", "а это только в майке можно".

Потом некоторое время существовала легенда "моделинг в максе, анимация в майке, эффекты к худини, рендеринг в рендермане".

Сейчас у нас тут похожие холивары случаются "Омни - говно, Сиденский - круче, Ранвей - отстой, Клинг - еще норм".

Принес вам два материала про постпродакшен "Дома Давида". Один про использование Клинга, а другой про использование Runway.

Там рассказано, что в кино уже пользуют ИИ в хвост и в гриву. Причем как для сокращения бюджета, так и для расширения рамок креативности. Там к сожалению нет деталей про апскейл и битность цвета, но я сейчас вот о чем.

Вся эта видеогенерация вползает в постпродакшен прямо сейчас, и не будет "лучшего" генератора или апскейлера.
Разные команды одной компании могут использовать разные тулы и выбор может определяться даже личными предпочтениями лидов.

Пока у нас вырисовываются смешные пайпланы (по аналогии с макс-майя-худини) - сиденс для драк, омни для композа и редактирования, клинг для лиц(например)).

Но все это будет меняться каждые три месяца. И все будут использовать всё.

Я реально себя чувствую как в начале нулевых, когда версии майки и рендермана выходили каждые полгода и приводили в восторг юзербазу новыми фичами.

https://youtu.be/atldP-5oKUY

https://runwayml.com/customers/how-house-of-david-used-runway-to-become-amazons-latest-hit-series

@cgevent
👍496🔥2
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

Голубь 2. Короткометражный фильм.

Автор: Анатолий Гейко

Ну что ж, прошлой осенью, как только появилась банана, я собрал первый экспериментальный игровой короткий метр "Голубь", который уже выставлялся на прожарку. После участия в фестивалях и положительных отзывов о фильме, я принял решение продолжить историю и таким образом родилась вторая часть фильма. Голубь 2. Короткометражный фильм.
Теперь быстро о производстве.
Персонажи проработаны через банану. Генерация видео: сиденс 2.0 и немного клинг 3.0.
Из важного. Я категорически не хотел липсинга из вео, как в первом фильме, поэтому искал решение с голосом на русском языке, т.к. сиденс не умеет, да и там нельзя это контролировать. В итоге голоса главного персонажа и наблюдателя сделал в элевен лабс и добавлены в сиденс в генерацию с изображением персонажей. В тот момент ещё сиденс сильно ругался на лица, поэтому приходилось сетку на лица использовать.
Саунддизайн из генераций сразу с видео. Музыка суно.
Апскейл в топаз.
Монтаж в премьер про.
Общее время на создание: две недели с перерывами.
И да, информация в начале фильма изучена и основана на исследованиях.
Бюджет: не знаю, но около 2-3 тыс токенов в синткс.

Так же, фильм можете посмотреть на ЮТУБ и РУТУБ

@cgevent
👍39👎187🔥6
Новый генератор картинок от Микрософта. С кодом

Microsoft Lens:
Base datasets Lens-800M
3.8B DIT with 48-block MMDiT
FLUX.2 VAE
TE ~GPT-OSS 20B
Base resolution 1440×1440
4step Lens-turbo without and 50 steps Lens-Base with CFG

Главный плюс - она очень быстрая. Ну и опенсорсная.

На этом плюсы как-то приподзаканчиваются.

Она еще как-то затаскивает абстрактные картинки, концепты, узоры. Но сыпится на людях.
Но самое удивительное, что у нее практически нет цензуры. Даже на уровне демо.
Правда ее видение анатомии вселяет священный ужас (не открывайте картинку ни в коем случае).

Демо тут:
https://huggingface.co/spaces/multimodalart/lens

Модели:
https://huggingface.co/microsoft/Lens
https://huggingface.co/microsoft/Lens-Turbo
https://huggingface.co/microsoft/Lens-Base

Код:
https://github.com/microsoft/Lens

Комфи:
https://huggingface.co/Comfy-Org/Lens

@cgevent
😱31😁298👍4👎4
This media is not supported in your browser
VIEW IN TELEGRAM
Gemini Omni: перевод, липсинк и дубляж с попаданием в губы.

Тут некоторые стартапы нервно закурили на лестнице, ведущей вниз.

Омни может переводить аудио, даже если в промпте не указано ни исходного, ни переведенного текста:
- попадает в губы для нового языка
- фоновая музыка остается без изменений
- при необходимости корректирует длину ролика(!).
Например, японская и испанская фразы во время крупного плана с кремом длиннее, поэтому Омни просто домонтирует пару секунд сама.

@cgevent
🔥116👍2712
This media is not supported in your browser
VIEW IN TELEGRAM
Генерация или видео?

@cgevent
😁91😱16🔥12👎2
Seedance 2.0 - 16fps?

Довольно интересная статья, из которой следует, что 24фпс, которые выдает Сиданский - это на самом деле 16фпс, разогнанные до 24 путем дублирования каждого второго кадра.

Ну то есть кадры можно пронумеровать и представить вот так:

1 2 2
3 4 4
5 6 6
7 8 8
9 10 10
11 12 12

Где одинаковые номера - это дубликаты.

Автор заметил это, когда склеивал несколько клипов и смотрел на стыки.

Там также интересный анализ видеопотока.

За кадром остаётся вопрос почему и зачем Сидэнс так делает (экономия, датасеты).

Но самые глазастые могу почувствовать эффект stutter - "заикание/залипание".

Автор предлагает всем проверить его результаты и даёт все инструменты для этого.


https://x.com/TomLikesRobots/status/2058866439352688907

@cgevent
👍33😱21🔥86👎3😁1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

«Сицилимпилимбилия»

Автор: Олег Усков (@quentyn_oleg)

YouTube:
VK:

Я принял участие в ИИ-кинофестивале @MyFilm48. За 96 часов нужно было создать короткометражный фильм на одну из предложенных тем. Лейтмотив этого сезона - Канны, я выбрал тему «Путешествие на Круазетт» · Professional. Уже около 20 лет я занимаюсь графическим дизайном: упаковкой, вебом, 3D — в общем, полный набор, но кино никогда не делал. Это мой дебютный фильм.

Написание сценария заняло около 12 часов — с 16:00 до 4:00. У меня были наброски безумных словечек ещё со студенчества, и я связал их в единую концепцию детской сказки, а затем думал, как сделать из этого комедию и при этом не показаться сумасшедшим)

ChatGPT использовался как помощник для раскадровки, но, честно говоря, было много проблем: он постоянно путался в терминологии, пытался что-то додумывать, и получалось это не всегда удачно)

Изначально я продумывал каждого персонажа: как они попали в эту точку, какие у них странности. Отдельно описывал внешний вид и поведение каждого в разных ситуациях. Поэтому дальше хоть сериал могу зафигачить с ними) Также заранее продумывал локации, чтобы во втором акте сделать красивый таймлапс.

Раскадровку я делал практически на каждый ракурс и каждую сцену. Мне было важно создать эффект последовательного повествования и атмосферу серьёзного фильма. За изображения в основном отвечала ChatGPT Image 2.0, часть делалась в Nano Banana 2, а затем дорабатывалась вручную в старом добром Photoshop. Встроенные Firefly и Nano Banana тоже помогали в процессе.

ChatGPT делает очень реалистичные картинки и хорошо понимает человеческий язык без сложных промтов, а ещё отлично сохраняет персонажей, но у него много ограничений. В Nano Banana, наоборот, можно творить огромное количество дичи, но и ошибок там в разы больше.

По видео: Adobe Premier, KLING 3 (всех разновидностей) и SEEDANCE 2.0. Сначала я делал блоки по 15 секунд мультишотом, собирал фундамент, а потом дорабатывал каждую сцену отдельно — обычно по 3–6 секунд. Основная платформа для реализации была – TapNow она дала мне 24 000 токенов на создание фильма — это эквивалент примерно 240$. Абсолютно всё было благополучно потрачено на видео) Так же использовал платформу weavy для каких-то доделок.

SEEDANCE дороговат, поэтому использовался только там, где KLING уже просто не мог выдать нужный результат. SEEDANCE объективно умнее и точнее понимает промты — без него некоторых сцен просто не существовало бы.

Нейросетевая озвучка мне не понравилась. Я собрал первую версию фильма, и с такой озвучкой она была попросту несмешной. Сначала я начал начитывать текст за режиссёра сам, но в итоге отдал эту роль своему другу, а сам озвучил Миллиардера — под него мой голос подошёл лучше.

Конечно, английские диалоги остались нейросетевыми, и приходилось немного поднимать и опускать голоса по тональности, чтобы хоть как-то всё сгладить. После всех этих манипуляций я отдал материал звукорежиссёру, и он за скромные 40$ сделал из ужасного звука с диктофона и остальных исходников вполне слушаемый и вменяемый результат — именно то, что вы слышите в финале.

Напоминаю: всё делалось в адском agile-режиме, и времени сравнивать, выбирать и доводить до идеала просто не было. Но когда я проснулся после сдачи, я все же немного допилил фильм, и убрал ляпы которые меня наиболее сильно бесили, и даже оставил одну пасхалку.

За музыку отвечает наша с другом группа «Проект Котята». Тоже готовим релизы в ближайшее время.

Липсинк — SyncPro 3, ну, может, долларов 5)

➡️ИТОГ: около 300$ на все про все, 96 часов работы, минимум сна. Было бы баксов 500-700 и хотя бы 144 часов, думаю можно было бы сделать приблизительно идеально.

Мой фильм выиграл в двух номинация, и был показан во Франции.

В Каннах 21 мая в отеле Gray d'Albion подведены итоги VII сезона международного кинофестиваля @MyFilm48.

🏆«Сицилимпилимбилия» занял 1-е место в категории «Путешествие на Круазетт» · Professional VII сезона @MyFilm48.

🏆Специальный приз жюри от AI Film Awards.

@cgevent
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥87👎41👍2013
Forwarded from эйай ньюз
Bonsai Image 4B — чудеса квантизации

Стартап PrismML, специализирующийся на экстремальном сжатии моделек, сделал квантизированную до одного бита FLUX.2 Klein 4B, вышло на удивление достойно. С таким уровнем квантизации Diffusion Transformer занимает всего лишь 930 мегабайт в 1-битном варианте и 1.2 гигабайта в тернарном варианте. Текстовый энкодер настолько же сильно ужать не удалось, поэтому весь комплект весит ~3.5 гига.

Такая квантизация позволяет запускать модель прямо в браузере и на телефонах, используя лишь 2 гигабайта оперативки. На генерацию 512x512 картинки на iPhone 17 Pro Max с такой моделью уходит 9.4 секунды при 4 шагах, что неплохо если учитывать факт офлоадинга. Ждём моделек побольше, для локального деплоймента.

Инференс в браузере
Веса

@ai_newz
👍23🔥105
Media is too big
VIEW IN TELEGRAM
ElevenLabs Music V2

Обновили свою модель генерации музыки.

Inpainting - можно перегенерить только выбранную часть трека.
Быстрые смены стиля прямо внутри одного трека
Немузыкальные шумовые эффекты внутри треков.

Но самое интересное, что они обещают API, чего нет у SUNO.

Впрочем, китайские умельцы уже давно соорудили лайфхаки:
https://kie.ai/suno-api

@cgevent
👍239
Небольшой промпт-гайд для Gemini Omni прямо от Google

Есть примеры промптов

Основные правила

1. Используйте знания из реального мира.
Вам не нужно слишком подробно объяснять мир Gemini Omni. Он создан с учетом глубокого понимания истории, науки и культуры, поэтому может надежно создавать результаты, которые выглядят, ощущаются и движутся реалистично. Избегайте подробных описаний. Используйте культурные ориентиры, исторические эпохи или научные термины непосредственно в своем задании.

2. Возьмите под контроль отрисовку текста.
Gemini Omni не только обладает расширенными возможностями рендеринга текста, но и позволяет плавно интегрировать текст в визуальные эффекты. Вы можете задать типографику, пространственное расположение, стили анимации и сложные визуальные эффекты, такие как двойная экспозиция, — всё это идеально синхронизировано с действием в вашем видео.

3. Направляйте камеру.
Думайте как оператор. Omni невероятно хорошо реагирует на точные указания по видеосъемке, типам камер и кадрированию. Попробуйте включать эти термины в ваши промпты.

4. Монтаж и композ.
Каждое отличное видео создается на этапе монтажа. С Gemini Omni вам не нужно переписывать весь сценарий с нуля, чтобы исправить одну-единственную ошибку. Запросите конкретные, целенаправленные изменения, например, смену фона или замену подписи. Omni сохранит основную структуру вашего видео при многократном внесении правок, позволяя вам сосредоточиться только на том, что нуждается в корректировке.
Хотите изменить темп или эмоции персонажа прямо посреди сцены? Вы можете напрямую настроить Gemini Omni на изменение движений или взаимодействия объекта с окружающей средой, не нарушая целостность модели персонажа.

https://x.com/GoogleAI/status/2059381218660270435

@cgevent
1👍34🔥126
Forwarded from Neural Shit
Таки там прошла первая Олимпиада для биохакеров-торчков. Enhanced Games.

Концепт прост и незатейлив: отменяем все спортивные комиссии и допинг-контроли, вкалываем в себя всё, что не прибито к полу, и идём ставить мировые рекорды. Организаторы гордо выкатили статистику подготовки: 91% атлетов плотно сидели на тестостероне, 79% на гормоне роста, а ещё в ход шли стимуляторы и прочие спиды. За обычную победу давали 250к долларов, за мировой рекорд лям баксов.

Казалось бы, нас ждёт парад мутантов-супергероев. Но всё прошло скучно:

Американский спринтер Фред Керли обещал разорвать рекорд Усэйна Болта в клочья, а в итоге пробежал 100 метров за 9.97 сек. На обычной олимпиаде в Париже несколько лет назад он же бежал без всякой фармы и показал 9.81.

Чистые спортсмены которые затесались на этот праздник химии, умудрились выиграть несколько дисциплин.

— Единственный мировой рекорд выдал грек: 50 метров вольным стилем за 20.81. На 0.07 быстрее официального мирового рекорда. Правда, этот чувак помимо запрещенных веществ использовал какой-то хитрый запрещённый плавательный костюм. А потом интернет-сыщики ещё и выяснили, что у организаторов были какие-то траблы с таймером.

Пока вывод такой: на обычной Олимпиаде фарма посильнее будет химия, это прошлый век и полумеры. Ждём, когда выкатят чувака с титановыми ногами от Бостон Динамикс, вот тогда и поговорим про рекорды.

тут подробнее
😁479