Метаверсище и ИИще
51.4K subscribers
6.53K photos
5.33K videos
48 files
7.63K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
Ну, за барабанщиков. И аниматоров.

Disney Research научили 3Д-пероснажа играть на барабанах слуiая обычную музыку.

На вход подаётся аудио, а diffusion-модель генерирует полноценную 3D-анимацию барабанщика - движения корпуса, рук и палочек, причём удары должны попадать в нужный барабан в нужный момент. Это сложнее обычной music-to-motion: палочка движется быстро, промах даже на несколько сантиметров сразу ломает иллюзию. Поэтому авторы разделили обучение на две задачи: естественность скелетной анимации и отдельно точность палочек. В результате заявлена точность попаданий до сантиметрового уровня, при этом тело не превращается в механического робота.

Что невыносимо круто - системе не нужен MIDI или заранее размеченный трек с нотами. Авторы собрали собственный датасет, придумали аугментации и добились работы с обычным аудио, которого модель не видела при обучении. Для проверки они даже ввели две отдельные метрики: расстояние между палочкой и целью в момент удара и корреляцию движения с аудио. В пользовательских тестах сгенерированную анимацию часто не могли отличить от настоящего motion capture.

Еще раз: это уже не просто "персонаж двигается в ритм", а попытка восстановить из одной звуковой дорожки физически осмысленное исполнение на конкретном инструменте

И тут басисты "до-соль, до-соль". ИИ такой: а я тут зачем, там два кадра разных всего...

Контр-фагот: а у меня вообще один кадр!

Может быть полезно для игр, виртуальныо-метаверсных музыкантов и ну и автоматической анимации персонажей.

https://studios.disneyresearch.com/2026/08/18/generalized-audio-driven-synthesis-of-precise-drummer-motion

Дирижёр останавливает репетицию, смотрит на музыканта и говорит:
— Контрфагот, сыграйте ноту фа!
Музыкант издаёт низкий звук: «Тпррр-р-р».
Дирижёр:
— А теперь сыграйте фа-диез!
Музыкант снова издаёт такой же низкий звук: «Тпррр-р-р».
Дирижёр машет рукой:
— Ай, играйте, что хотите!


@cgevent
😁29🔥10👍52👎2
This media is not supported in your browser
VIEW IN TELEGRAM
Фазовщики, заливщики, контуровщики.

Для тех, кто помнит, что такое штифты(есть на видео) и калька. И ацкие сканеры.

Наверное никто уже (кроме нейродеда) не помнит (а 95% и не знают), то в классической мультипликации были три самые пьющие профессии. Фазовщики, контуровщики и заливщики.
Гениальный режисер-мультипликатор рисовал только ключевые кадры своей твердой (не всегда) рукой. На кальке. Типа мячик на земле, мячик в воздухе.
Потом приходили фазовщики, и дорисовывали недостающие кадры, чтобы было 12 кадров в сек. Это примерно то, что делает любой 3Д-пакет, интерполируя движение между ключевыми кадрами, поставленными аниматором.
Потом приходили контуровщики и обводили карандашные наброски жирными черными контурами и переносили все это на целлулоид.
Потом приходили самые пьющие, заливщики. Они переворачивали целлулоид и заливали внутренность контуров цветными красками. Чтоб было красиво и в соответствии с колор-чартом. Переворачивали, чтобы контур был "сверху" над заливкой, если перевернуть обратно.
Работа была ацкая, люди реально спивались (вы думали, откуда такая склонность выпивать не чокаясь).

На видео босс рисует, остальные пока разминаются.

@cgevent
67😱34🔥18😁5🙏2👎1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

“Exquisitely Empty”

Автор: @BaroVilgotsky

Музыкальный клип для группы OMEGA DARK на песню “Exquisitely Empty” с альбома ‘Anhedonia’ (2026). Жанр - darkwave/industrial. Клип выдержан в стилистике horror/arthouse (не совсем для слабонервных)

Генерация изображений - NanoBanana 2, NanoBanana Pro
Генерация видео - Seedance 2.0
Монтаж - Movavi Video Editor
Музыка - FL Studio 21, доработка в Suno
Запись вокала - Cockos Reaper. Липсинк - встроенный в Seedance 2.0
В целом работа над клипом заняла около двух недель, с учётом того, что велась она нерегулярно.
Бюджет ~ 3500 рублей.
Ссылка на клип на YouTube: https://youtu.be/EkbxN5afefs
Альбом ‘Anhedonia’ на VK Music: https://vk.com/music/album/-2000269457_28269457_e2b0b5f24aa699ae59
Альбом ‘Anhedonia’ на Яндекс.Музыке: https://music.yandex.ru/album/42823842

@cgevent
👎70👍9😁4😱4🙏1
GPT image 2.5

На арене новый чекройнт от openAI под названием luna-lisa-alpha

Обновили knowledge coutoff

Приподубрали зерно

Вроде не желтит

Ждём официального анонса.

@cgevent
🔥70👍19👎32😱1
This media is not supported in your browser
VIEW IN TELEGRAM
MAI-Image-2.5-Pro - бардак в версиях и бенчах.

Наводим порядок.

Microsoft выкатила (ещё 23 июля как превью) MAI-Image-2.5-Pro - отдельную high-fidelity версию 2.5 для сложных коммерческих картинок и редактирования. Упор на сохранение персонажей и объектов, материалы и пропорции, точечные правки и текст в изображении.

Важный нюанс: появившаяся через три недели MAI-Image-2.6 - уже следующее поколение. Она заняла #2 в Text-to-Image Arena и сильно обогнала обычную 2.5, особенно в тексте и сложных композициях.

Но 2.5-Pro в Arena отдельно не тестировали, поэтому утверждать, что 2.6 лучше Pro, пока нельзя.

Более того 2.5 Pro сейчас на другой Арене приподпобила GPT Image 2.l, выйду на первое место.

Ну то есть ситуация похожа на Нанабанану 2 и Pro. Разные ветки. Сравнивать сложно.

Я вообще не фанат Микрософтовских генераторов: дорого, спорно, кривой playground, лицензия, до сих пор пальцы рандомные.

Для тех, кто фанат.

2.5-Pro уже можно запускать через Microsoft Foundry, fal и WaveSpeed, у агрегаторов получается примерно от $0.11-0.30 за картинку.

2.6 пока проще всего бесплатно щупать в MAI Playground и Arena, публичной API-цены еще нет. Судя по анонсу, именно 2.6 станет основной моделью Microsoft: ей готовят multi-reference, richer grounding и больше контроля над reasoning, разрешением и форматом.

А я жду новый GPT Image...

https://microsoft.ai/news/introducing-mai-image-2-5-pro-and-mai-voice-2-flash/

https://microsoft.ai/news/mai-image-2-6-launches-at-no-2-on-arena-ahead-of-google-meta-and-xai/

https://learn.microsoft.com/en-us/azure/foundry/foundry-models/how-to/use-foundry-models-mai-image

https://fal.ai/models/microsoft/mai-image-2.5-pro

https://wavespeed.ai/models/microsoft/mai-image-2.5-pro/edit

https://playground.microsoft.ai/

https://arena.ai/leaderboard/text-to-image

@cgevent
7👍5😁5👎1
Редкий шанс разобрать методологию медиабаинга с теми, кто каждый день видит, как устроена закупка внутри команд на больших спендах – и задать свои вопросы экспертам в перформанс маркетинге, автоматизации и ИИ.

Ещё недавно при росте бюджета команды просто нанимали больше байеров. Сейчас регулярка – тесты, перезапуски, масштабирование – уходит в автоматизацию с помощью агентов, и вопрос уже не «автоматизировать ли», а что именно и в каком порядке.

Кирилл Макаров (Webfunnels Club), Сева Устинов и Кирилл Касимский (основатели Plurio) разберём, из чего сегодня собирается рабочая методология: производство креативов, аналитика, тестирование и масштабирование, рутина закупки и привязка к бизнес-целям.

Это разговор не про AI ради AI, а про рабочую методологию закупки: как связать бизнес-цели, производство креативов, аналитику, тестирование, масштабирование, оптимизацию и ежедневные действия в рекламных кабинетах.

Разбирать будем на опыте работы с клиентами с совокупным spend $500m/y.
Один из свежих примеров — Finom, топ-3 необанк Европы для малого бизнеса. В Meta одновременно крутилось 500+ active ads / creative variations. За 5 месяцев сделали x2 новых клиентов и снизили CAC на 57%.

Главный вопрос вебинара: как превратить закупку из набора ручных решений в операционную систему, где каждый день понятно, что масштабировать, что резать, что тестировать и что автоматизировать.

Разберём:
— как понять, что Meta реально создаёт новых клиентов, а не просто доедает существующий спрос
— когда дать алгоритму время, а когда резать spend без сожаления
— как управлять сотнями креативов: naming, signals, fatigue, winners / losers
— какие правила и workflows стоит автоматизировать первыми
— как связать бизнес-цели, LTV, CAC и payback с ежедневными действиями в кабинете
— где обычно ломается команда на spend $500k–$5M в месяц

Кирилл Макаров, основатель Web Funnels Club и кофаундер проекта, который быстро вырос именно на закупке в Meta, расскажет, как у него устроена методология роста и масштабирования: какие решения принимаются, какие практики работают и как это выглядит внутри команды.

Кирилл Касимский расскажет, что работает у крупных клиентов с бюджетами в миллионы долларов в месяц: где ломается управление на больших объёмах и какие подходы помогают не терять эффективность.

Cева Устинов будет вести разговор и доставать из Кириллов не “интересные кейсы”, а рабочую методологию: какие решения принимать каждый день, чтобы закупка росла, а CAC не расползался.

Для кого:
— Head / Lead UA
— Performance / Growth leads
— CMO и фаундеры, которые лично отвечают за CAC, новых клиентов и масштабирование Meta
— команды с Meta spend от $500k в месяц
— те, кто понимает, что ручного управления уже недостаточно, но не хочет превращать AI в игрушку поверх дашборда


Не подойдет вам, если только начинаете запускаеть перформанс-маркетинг или ищете базовые настройки кампаний, будет слишком операционно.


26 августа
19:15 CET
Онлайн
Бесплатно
Полтора часа

Зарегистрироваться

@cgevent
👎243🔥2👍1😁1
Forwarded from AI Product | Igor Akimov
Как сейлзы Anthropic используют AI

Очень показательные кейсы про область, про которую мало пишут. AI в продажах (как обработке входящих заявок, так и всяких там холодных звонков/писем-линкединов). Выложил Джон Альберт – как их команда business development живёт внутри Claude Cowork. Типа год назад тратил ~5 часов в день на разбор входящих в sales-inbox и отвечал на одни и те же вопросы. Теперь почти всё это – скиллы и расписанные по таймеру задачи.

Что у них крутится:
– База знаний. Документ с типовыми вопросами клиентов и лучшими ответами. Клод сам его собрал из продуктовых доков и каналов, сам же периодически помечает, что устарело. Без этого документа ничего дальше не работает.
– Inbox-скилл. Раз в час сканирует почту, находит треды, где нужен ответ, и оставляет черновики. Внутри – тонкий системный промпт, база знаний как контекст и профиль стиля конкретного сейлза (его отдельный voice-скилл собирает из писем и документов человека).
– Ночной прогон по всей книге аккаунтов (их у него 100+). Клод ходит в Salesforce, Apollo, Common Room, Gong и их data warehouse, проверяет сигналы против ICP и утром выдаёт по каждому аккаунту бриф, скор и outbound-план, чего кому написать. Ведёт небольшой memory-файл, чтобы не делать одно и то же дважды.
– Pipeline-скиллы: сверяет стадии сделок в Salesforce с тем, что реально происходит в Gmail и Gong, и предлагает апдейт с доказательствами – но только предлагает, человек апрувит. Если отклонил – записывает причину, чтобы не повторять.
– Мелочь, но приятная: скилл ловит no-show на встречи и «ушедших в тень» клиентов; другой раз в несколько часов берёт новые лиды из CRM и пишет первое касание.
– Call-coach: разбирает транскрипты Gong против плейбука discovery-звонков – три плюса, три минуса, pass/fail и одна вещь, которую тренировать дальше. Прикольно, что они используют дорогущий гонг вместо своих агентов :)

И ещё набор разовых запросов без скиллов: дашборд по usage аккаунта «в один промпт», поиск "скрытого использования" (уже пользуются продуктом, а сделки в CRM нет), подбор аккаунтов под вебинар по ICP.

Основные советы для компаний, что только начинают: сначала база знаний, потом воркфлоу; давать Клоду примеры того, как работает команда, а не абстрактные инструкции; человек на проверке каждой отправке; фидбек записывать обратно в скилл.

Ну и да, показательна нормальная архитектура: хороший адаптированный промпт + курируемый контекст, регулярно обновляемый, + память об ошибках + человек на кнопке «отправить», а не "фабрика агентов". Короче, нормальный контекст и самоусиливающая обратная связь. Супер-полезно конечно такие вещи читать не от всяких блогеров.

https://claude.com/blog/how-anthropics-business-development-team-uses-claude-to-run-inbound-and-outbound-at-scale
👍3219👎5🔥3
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

Музыкальное видео-эксперимент на тему: А что, если бы современные брейкеры и диджей(ка) оказались в средневековом сеттинге?

Автор: Виталий Мостовой

Заняло пару выходных и еще один день. Идею вынашивал до этого пару месяцев. В итоге решил затестить, как Сиденс справляется со сложными танцами, и несколькими людьми в кадре. Благо, есть тариф с анлимом на Сиданс в Ранвее, иначе на кредиты пришлось бы оформлять микрокредит)
Статировал в ГПТ, анимировал в Сидансе, монтировал в Премьере, саундтречил в Суно. Возни было много, только на монтаж день ушел, уже под конец начало накрывать, но отступать было некуда.
Хотелось не делать серьезный видос, и чтобы немного настроение поднимал, ну вот получилось, что получилось)

@cgevent
1👍67👎35😁18🔥118🙏1
This media is not supported in your browser
VIEW IN TELEGRAM
Тема сисек раскрыта...

Скорей бы восстание робатов.

@cgevent
😁39🔥21👎118👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Black Forest Labs бахнули FLUX Video Upscale

И это уже интересно - вообще отдельная модель для апскейла видео до 1080p, 2K и 4K.

Модель перегенерирует детали, исправляет размазанные лица, глаза и артефакты на сложных текстурах вроде воды и травы. Особенно она заточена под видео FLUX 3, но принимать может вообще любое видео от 480p.
Есть два режима: Precise максимально сохраняет исходник и идентичность, а Creative агрессивнее восстанавливает и дорисовывает детали.
Апскейл от1.5x до 3x, звук сохраняется, максимум 20 секунд и 50 МБ за один запрос.

Что у BFL реально интересно:
Это generative/restorative upscale, а не классический ESRGAN/Topaz-style resize + sharpen.
Он специально заточен под артефакты генеративного видео: размазанные лица, странные фактуры травы, воды и т.п. BFL прямо это заявляет.

Он знает внутреннее распределение FLUX 3, то есть потенциально может восстанавливать видео FLUX 3 лучше универсальных апскейлеров. Звучит нарядно. Надо проверять.

Попробовать можно прямо сейчас в официальном BFL Playground, без API и кода: загружаешь ролик, выбираешь FLUX Video Upscale и коэффициент апскейла.
Для разработчиков есть отдельный API endpoint "/v1/flux-tools/video-upscale-v1". Цена считается по разрешению и длительности готового ролика: Precise - $0.07 за мегапиксель-секунду, Creative - $0.10. Например, 10 секунд в 1080p обойдутся примерно в $1.39 / $1.98 соответственно. Цена в Playground такая же, как через API.



Попробовать:
https://dashboard.bfl.ai/playground?model=flux-3-upscale

Описание:
https://bfl.ai/blog/flux-video-upscale

Документация:
https://docs.bfl.ai/flux_tools/flux_video_upscale

Цены:
https://bfl.ai/pricing?category=flux+video+tools

@cgevent
🔥26👎7👍4
Forwarded from AI Product | Igor Akimov
Deepseek выкатил мультимодальную модель!

deepseek-v4-flash-vision-exp – принимает картинки вместе с текстом: описание изображений, чтение скриншотов, анализ графиков.
По тексту (агенты, reasoning, знания) – на уровне обычного V4-Flash, а на мультимодальных агентских бенчмарках – большой скачок, близко к Opus 4.8
Картинка стоит максимум 384 токена – всё, что больше ~800×800, сжимается до этого размера. 2000×2000 и 5000×5000 съедят одинаково
– тарификация – по ценам V4-Flash: при $0.14/1M input это ~18 тысяч изображений на доллар (в off-peak часы – вдвое дешевле)
– до 600 изображений в одном запросе, форматы JPEG/PNG/GIF/WebP, есть Files API для переиспользования
– работает через три интерфейса сразу: OpenAI Chat Completions, Responses API и Anthropic-совместимый /messages

Короче, надо пробовать. Стоит как обычно копейки вообще. Должна быть сильно и в обработке документов, и в обработке графики (кроме совсем уж плотных текстов)

https://api-docs.deepseek.com/news/news260821/
🔥288👍3👎1
Культура ИИ-отмены

Нигерийский писатель Джерри Фаладе написал дебютный криминальный роман Call Me, I’ll Hide the Body. Рукопись вызвала настоящую истерику среди издателей: аукцион с участием 14 компаний, несколько шестизначных предложений в Великобритании и около $2-2,4 млн от принадлежащего Macmillan издательства Minotaur за две книги. Роман собирались выпустить как один из главных релизов 2028 года. Кожаные агенты называли текст «гениальным» и утверждали, что в него влюбились буквально все.

Затем один из редакторов заметил в тексте признаки возможного использования ИИ. Важный нюанс: книгу снял с продажи не издатель после автоматического AI-детектора, а собственные агенты Фаладе. Сначала они поверили его заверениям, что ИИ не применялся ни при написании, ни при редактировании. Но после некой встречи 29 июля, когда некоторые детали его объяснений якобы изменились, агенты заявили, что больше не могут подтвердить происхождение рукописи, срочно разорвали отношения и отозвали книгу со всех торгов. Публичных доказательств генерации текста при это НИКТО не представил.

Сам Фаладе всё отрицает. Он говорит, что располагает черновиками, заметками, датированными сообщениями и материалами ещё 2021 года, то есть до появления ChatGPT. Publishers Weekly действительно ознакомился с частью таких сообщений, но они подтверждают лишь то, что Фаладе давно занимался художественным текстом, а не обязательно происхождение каждого фрагмента финальной книги. Писатель также считает, что подозрения могут быть связаны с расовой предвзятостью.

Самая кожаная часть истории: 14 издателей прочитали якобы «иишный» роман, устроили за него драку и предложили миллионы. И только потом кто-то вспомнил, что ИИ-текст положено презирать. Но утверждать, что книга точно написана нейросетью, тоже пока нельзя.

Самое главное: по состоянию на 21 августа прув или антипрув так и не появился. Ни отчёта AI-детектора с анализом текста, ни сравнений конкретных фрагментов, ни доказательства генерации глав/абзацев, ни судебного иска Фаладе. Свежая большая статья WSJ на этой неделе всё ещё описывает дело именно как случай suspected AI use, а не установленного AI-авторства.

Это я к чему? Вовсе не к тому, кто писал книгу.

А к тому, что теперь нас ждёт новая культура отмены. Можно стукануть или намекнуть, что кто-то использует ИИ - и хоп, кожаные отменяют кожаного, хоть только что вылизывали ему все места. Все это про устройство кожаных, а не ИИ.

Кожаным всегда были важны шашки, а не ехать.

ИИ просто вытаскивает наружу кожаое лицемерие.

Клевая музика?
Да!
Это ИИ.
Фу, песок и тупая аранжировка, отменяем автора.

https://www.wsj.com/business/media/author-whose-2-million-book-deal-was-derailed-by-ai-concerns-says-hes-innocent-c9f4c91b

https://www.publishersweekly.com/pw/by-topic/industry-news/publisher-news/article/100983-after-the-cancellation-of-call-me-i-ll-hide-the-body-what-comes-next.html

https://www.wsj.com/arts-culture/books/generative-ai-book-publishing-be79a287

@cgevent
👍8717😱17🔥11😁2
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

Быстрый оффер

Автор: @YASNO

В мрачной тьме далёкого будущего есть только РПЛ. А ещё там есть быстрые генерации: на весь процесс от идеи до релиза у меня ушло 7 часов работы и порядка $50 кредитов.

Поехали! Быстрый концепт-арт на стилшотах — броня, игровое поле, персонажи и, главное, пэкшот по гайдам — всё Nana Banana Pro. Далее — анимация коротких сцен, коротких настолько, чтобы артефакты варпа не успели ворваться в кадр. Космодесу предусмотрительно надеваем шлем и выпускаем на сцену сердитый Kling O3. Интершумы дёргаем из его же генераций. Теперь нужен коммерческий поставленный голос, которому вручную можно задавать тон — это работа для ElevenLabs. Завершает концерт Suno: намекаем ему на сюжет и хронометраж, он схватывает всё на лету и сводит трек. Готово. Пусть едет харя набекрень у человека на трибуне, но главное — сеттинг считывается.

Реальность рекламных фильмов сегодня — это утренний инфоповод, который нужно отбить уже к вечеру. И делается это примерно так.

@cgevent
1👎84🔥115👍3😁1😱1
На OpenRouter бесплатно бахнули неизвестную frontier-модель Ox Alpha

https://openrouter.ai/stealth/ox-alpha

Шняга явно заточена под кодинг и агентов: миллион токенов контекста, до 131К на выходе, reasoning, tools, плюс она понимает не только текст и картинки, но и видео. Типа мультимодальная.
На маленьком 10-задачном прогоне DeepSWE получила 80% против 65% у Fable и 52% у Sol. Выборка крошечная, и твитторские пишут, что до Фаблика ей далековато.

А дальше начинается детектив. Реддитские прогнали Ox Alpha через fingerprint-тесты и обнаружили, что подсчет токенов совпадает с GLM-5.3, причем разница стабильно составляет всего 75 токенов, которые очень похожи на скрытый системный промпт. Еще интереснее видео: расход токенов на разных роликах практически повторяет GLM-5V-Turbo. Совпадают и некоторые ошибки API, режимы reasoning и характерные ответы. Поэтому основной подозреваемый сейчас Z.ai, бывшая Zhipu AI.

Но вот версия про конкретно GLM-5.3 Flash пока скорее пальцем в небо: Ox Alpha может оказаться вообще новым мультимодальным GLM-5.x, который еще не анонсировали.

Ништяк в том, что Ox Alpha пока отдают бесплатно, а OpenCode заявляет квоту до 100 триллионов! токенов в сутки. Похоже, вместо закрытой беты китайцы просто вынесли новую модель в интернет - такой маркетинг нам нравицца!

@cgevent
👍4010🔥9👎1
Египетский Дипсик

Работает на тростнике. При плюс 41.

Только что тестировал, освежает.

@cgevent
19😁39👎106👍5🔥1