This media is not supported in your browser
VIEW IN TELEGRAM
Ну, за Фотошоп
В последнее время слои в генераторах появляются все чаще: ideogram, Qwen Layered, Stability AI (Лора для Квена, писал вчера).
И вот уже долгожданный апдейт для Seedream 5.0 Pro.
Там появился Layer Separation - модель берет готовую картинку и автоматически разбирает ее на независимые слои: персонажей, предметы, фон и другие элементы. На выходе получаем отдельные PNG с прозрачностью, которые можно двигать, удалять и редактировать независимо друг от друга. Через fal можно получить от 2 до 17 слоев, а промптом указать, что именно нужно отделить.
На fal функция уже доступна в Playground и API. Цена считается за полученные слои: $0.03375 за слой для изображений до 1536×1536 по площади и $0.0675 за слой выше этого размера. То есть разбор картинки, например, на 10 слоев обойдется примерно в $0.34 или $0.68.
Попробовать: https://fal.ai/models/bytedance/seedream/v5/pro/layerize
API: https://fal.ai/models/bytedance/seedream/v5/pro/layerize/api
Официальный анонс Seedream 5.0 Pro: https://www.byteplus.com/en/activity/seedream5-0
@cgevent
В последнее время слои в генераторах появляются все чаще: ideogram, Qwen Layered, Stability AI (Лора для Квена, писал вчера).
И вот уже долгожданный апдейт для Seedream 5.0 Pro.
Там появился Layer Separation - модель берет готовую картинку и автоматически разбирает ее на независимые слои: персонажей, предметы, фон и другие элементы. На выходе получаем отдельные PNG с прозрачностью, которые можно двигать, удалять и редактировать независимо друг от друга. Через fal можно получить от 2 до 17 слоев, а промптом указать, что именно нужно отделить.
На fal функция уже доступна в Playground и API. Цена считается за полученные слои: $0.03375 за слой для изображений до 1536×1536 по площади и $0.0675 за слой выше этого размера. То есть разбор картинки, например, на 10 слоев обойдется примерно в $0.34 или $0.68.
Попробовать: https://fal.ai/models/bytedance/seedream/v5/pro/layerize
API: https://fal.ai/models/bytedance/seedream/v5/pro/layerize/api
Официальный анонс Seedream 5.0 Pro: https://www.byteplus.com/en/activity/seedream5-0
@cgevent
❤30🔥23👍4😁3
DeepSeek Harness
DeepSeek официально выложили DeepSeek Harness (dsh) - свой open-source харнесс для AI-агентов.
Главная идея у них буквально «everything is a plugin»: модель, инструменты, skills, сессии, sandbox, политика разрешений, хранение данных и даже интерфейс собираются как плагины. По сути это собственный аналог инфраструктурного слоя вокруг Claude Code / OpenCode / Codex-подобных агентов.
Причем Harness напрямую связан с новыми DeepSeek V4. В официальной документации DeepSeek указано, что V4-Flash на coding/agent-бенчмарках тестировали именно через DeepSeek Harness в minimal mode, с max reasoning effort, top_p=0.95, temperature=1.0. Результаты у V4-Flash заявлены приличные: Terminal Bench 2.1 - 82.7, DeepSWE - 54.4, Toolathlon Verified - 70.3, DSBench-FullStack - 68.7.
Уже можно запускать локально:
npx @deepseek-ai/dsh web
После этого поднимается Web UI на 127.0.0.1:3080. Есть и headless-режим, sandbox, shell/terminal tools, persistence, credentials, approval policy и возможность подключать другие модели через плагины. Пока статус Developer Preview.
Одновременно выкатили V4 Pro из превью под лицензией MIT
https://github.com/deepseek-ai/deepseek-harness
https://github.com/cordiverse/paper
Тут DeepSeek V4 Pro 0813
А почему такая странная фотка из отпуска в заголовке?
А просто эта странная шняга на поясе тоже называется harness (трапеция)...
@cgevent
DeepSeek официально выложили DeepSeek Harness (dsh) - свой open-source харнесс для AI-агентов.
Главная идея у них буквально «everything is a plugin»: модель, инструменты, skills, сессии, sandbox, политика разрешений, хранение данных и даже интерфейс собираются как плагины. По сути это собственный аналог инфраструктурного слоя вокруг Claude Code / OpenCode / Codex-подобных агентов.
Причем Harness напрямую связан с новыми DeepSeek V4. В официальной документации DeepSeek указано, что V4-Flash на coding/agent-бенчмарках тестировали именно через DeepSeek Harness в minimal mode, с max reasoning effort, top_p=0.95, temperature=1.0. Результаты у V4-Flash заявлены приличные: Terminal Bench 2.1 - 82.7, DeepSWE - 54.4, Toolathlon Verified - 70.3, DSBench-FullStack - 68.7.
Уже можно запускать локально:
npx @deepseek-ai/dsh web
После этого поднимается Web UI на 127.0.0.1:3080. Есть и headless-режим, sandbox, shell/terminal tools, persistence, credentials, approval policy и возможность подключать другие модели через плагины. Пока статус Developer Preview.
Одновременно выкатили V4 Pro из превью под лицензией MIT
https://github.com/deepseek-ai/deepseek-harness
https://github.com/cordiverse/paper
Тут DeepSeek V4 Pro 0813
А почему такая странная фотка из отпуска в заголовке?
А просто эта странная шняга на поясе тоже называется harness (трапеция)...
@cgevent
❤16🔥10😱8👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Для Минимаксеров: ComfyUI Minimax-H3 FaceRefine
Улучшатор маленьких лиц, которые обычно портятся.
- tracks, crops, regenerates faces at native resolution to fix distance-blurring
- YOLOv8 + InsightFace for identity-locked tracking
- img2img latent injection + temporal denoise scaling
- влезает в 12GB VRAM via GGUF.
https://github.com/Carasibana/ComfyUI-H3-FaceRefine
@cgevent
Улучшатор маленьких лиц, которые обычно портятся.
- tracks, crops, regenerates faces at native resolution to fix distance-blurring
- YOLOv8 + InsightFace for identity-locked tracking
- img2img latent injection + temporal denoise scaling
- влезает в 12GB VRAM via GGUF.
https://github.com/Carasibana/ComfyUI-H3-FaceRefine
@cgevent
🔥55❤13😁8👍5🙏5
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
Тизер к (существующему) короткому метру "MOTHER". (12 минут)
Автор: Ник Костомаров
В данный момент фильме поправляются мелочи и после хотим отправить на несколько ИИ фестивалей, поэтому пока не показываем публично.
Цель: попробовать свои силы в качестве сценариста и режиссера + для студии проработать пайплайн создания подобных фильмов.
Изначально была идея делать это на Клинге, Гугле, но сразу поняли, что генераций будет много, поэтому полностью отказались от платных и построили весь пайплайн на ЛТХ 2.3
Да, возможно он далеко не топовый, но зато бесплатный, поэтому генерить могли столько сколько было нужно.
Были написаны инструменты автоматизации запускающие генерацию прямо из Нюка в комфи и обратно
Картинки все генерились ГПТ. Все звуки, голоса и музыка ЭлевенЛаб. Липсинг везде родной.
Признаюсь много было ошибок в начале, пока выстраивали, настраивали и т.д.
Мое личное заключение - далеко от идеала. Но учитывая, что это мой первый проект + бесплатные модели + опыт полученный в процессе производства, доволен.
@cgevent
Тизер к (существующему) короткому метру "MOTHER". (12 минут)
Автор: Ник Костомаров
В данный момент фильме поправляются мелочи и после хотим отправить на несколько ИИ фестивалей, поэтому пока не показываем публично.
Цель: попробовать свои силы в качестве сценариста и режиссера + для студии проработать пайплайн создания подобных фильмов.
Изначально была идея делать это на Клинге, Гугле, но сразу поняли, что генераций будет много, поэтому полностью отказались от платных и построили весь пайплайн на ЛТХ 2.3
Да, возможно он далеко не топовый, но зато бесплатный, поэтому генерить могли столько сколько было нужно.
Были написаны инструменты автоматизации запускающие генерацию прямо из Нюка в комфи и обратно
Картинки все генерились ГПТ. Все звуки, голоса и музыка ЭлевенЛаб. Липсинг везде родной.
Признаюсь много было ошибок в начале, пока выстраивали, настраивали и т.д.
Мое личное заключение - далеко от идеала. Но учитывая, что это мой первый проект + бесплатные модели + опыт полученный в процессе производства, доволен.
@cgevent
👍26👎26❤8😱3
Рыбаков что-то знал...
Там Suno Studio обновилсо.
Завтра бахну.
P.S. для названия нового музыкального стиля просто отлично, ящетаю...
@cgevent
Там Suno Studio обновилсо.
Завтра бахну.
P.S. для названия нового музыкального стиля просто отлично, ящетаю...
@cgevent
😁37❤7👍7👎2
This media is not supported in your browser
VIEW IN TELEGRAM
За Суно. Много.
Бахнули Suno Studio 2.0 - большое обновление браузерной студии, которая теперь уже всерьёз пытается изображать полноценную DAW, а не просто место, где можно немного поковырять сгенерированный трек.
Главная новость - нормальная работа с MIDI: его можно импортировать, записывать и редактировать прямо на таймлайне, подключать MIDI-клавиатуры и контроллеры, а сами MIDI-клипы использовать как промпт(!) для новой генерации аудио. То есть сыграл аккорды или мелодию - и Suno может на их основе продолжить партию или сгенерировать новый кусок. Есть musical typing с обычной клавиатуры, арпеджиатор и chord mode.
Заодно Studio обросла вполне взрослыми инструментами: встроенный wavetable-синт, автоматизация параметров, EQ, компрессия, delay, distortion, reverb, включая sidechain compression и convolution reverb.
Но главный аттракцион - Chat Bar в бете. Ему можно человеческим языком заказать новый звук, пресет синта, обработку вокала или вообще собственный эффект-плагин, который потом сохраняется в аккаунте. Чат понимает контекст текущего проекта и способен сам собрать цепочку обработки.
Плюс обновили stem separation, можно импортировать свои аудиофайлы и стемы, экспортировать песню целиком, отдельные дорожки или выбранные участки.
До Ableton или Logic, конечно, пока как до Исландии - например, сторонние VST-плагины Studio 2.0 пока не понимает.
Но направление любопытное: Suno постепенно метит в AI-first музыкальную рабочую станцию.
А теперь жиза. Доступ к Studio остаётся только у подписчиков Premier.
Причём именно в Premier Сунченко запирает всю новую игрушку: Studio 2.0, MIDI, плагины, автоматизацию, Chat Bar, новые эффекты и DAW-интерфейс. В комплекте 10 000 кредитов в месяц, примерно до 2000 генераций песен, коммерческие права, приоритетная очередь и прочие возможности. При этом экспорт из Studio заявлен без лимитов по количеству и весьма приличный - multitrack/stems в 32-bit / 48 kHz.
Кстати, за создание собственных плагинов через Chat Bar ПОКА не расходются кредиты.
https://suno.com/blog/studio-2
https://suno.com/studio-welcome
@cgevent
Бахнули Suno Studio 2.0 - большое обновление браузерной студии, которая теперь уже всерьёз пытается изображать полноценную DAW, а не просто место, где можно немного поковырять сгенерированный трек.
Главная новость - нормальная работа с MIDI: его можно импортировать, записывать и редактировать прямо на таймлайне, подключать MIDI-клавиатуры и контроллеры, а сами MIDI-клипы использовать как промпт(!) для новой генерации аудио. То есть сыграл аккорды или мелодию - и Suno может на их основе продолжить партию или сгенерировать новый кусок. Есть musical typing с обычной клавиатуры, арпеджиатор и chord mode.
Заодно Studio обросла вполне взрослыми инструментами: встроенный wavetable-синт, автоматизация параметров, EQ, компрессия, delay, distortion, reverb, включая sidechain compression и convolution reverb.
Но главный аттракцион - Chat Bar в бете. Ему можно человеческим языком заказать новый звук, пресет синта, обработку вокала или вообще собственный эффект-плагин, который потом сохраняется в аккаунте. Чат понимает контекст текущего проекта и способен сам собрать цепочку обработки.
Плюс обновили stem separation, можно импортировать свои аудиофайлы и стемы, экспортировать песню целиком, отдельные дорожки или выбранные участки.
До Ableton или Logic, конечно, пока как до Исландии - например, сторонние VST-плагины Studio 2.0 пока не понимает.
Но направление любопытное: Suno постепенно метит в AI-first музыкальную рабочую станцию.
А теперь жиза. Доступ к Studio остаётся только у подписчиков Premier.
Причём именно в Premier Сунченко запирает всю новую игрушку: Studio 2.0, MIDI, плагины, автоматизацию, Chat Bar, новые эффекты и DAW-интерфейс. В комплекте 10 000 кредитов в месяц, примерно до 2000 генераций песен, коммерческие права, приоритетная очередь и прочие возможности. При этом экспорт из Studio заявлен без лимитов по количеству и весьма приличный - multitrack/stems в 32-bit / 48 kHz.
Кстати, за создание собственных плагинов через Chat Bar ПОКА не расходются кредиты.
https://suno.com/blog/studio-2
https://suno.com/studio-welcome
@cgevent
👍33❤10🔥9👎8😁2
This media is not supported in your browser
VIEW IN TELEGRAM
Minimax Music 3. Open Source!!
Музыкальная тема не отпускает, будем жечь дальше, хотя там вышла Gemini 3.7 Flash и GLM 5.3
Их позже обсудим.
Для ботов: ACE < Minimax < Suno.
Для тех, кто физическим не может в длинные тексты: MiniMax Music 3 - новая локальная open-weight модель, которая уже завелась в ComfyUI и умеет генерировать длинные полноценные песни с вокалом. Под капотом гибрид: 8B LLM на базе Qwen3-8B держит структуру трека, 0.6B LLM занимается локальными деталями, а Flow Matching + Flow-VAE превращают это в аудио.
Теперь для гиков.
Технически MiniMax Music 3 устроен заметно интереснее обычных audio-token моделей. Под капотом гибридная схема: 8B LLM на базе Qwen3-8B отвечает за длинную структуру трека, развитие куплетов, припевов и общую музыкальную логику; отдельный 0.6B LLM дорисовывает более локальные, покадровые акустические детали. После этого звук не декодируется напрямую из токенов: объединенные hidden states идут в 2.4B Flow Matching-модуль + Flow-VAE, которые уже синтезируют финальное аудио.
Уже есть поддержка ComfyUI
Официальный workflow MiniMax Music 3 сейчас выводит такие основные параметры:
-
-
-
- `seed` - есть.
-
Самое главное: железо
Не так все плохо, однако.
MiniMax официально пишет:
- full precision помещается менее чем в 24 GB VRAM
- с automatic CPU offload расход GPU около 22 GB
- с layer-by-layer streaming можно запустить даже на 8 GB VRAM, но заметно медленнее.
Для ComfyUI уже есть три чекпойнта(на момент написания):
-
-
-
Плюс отдельный VAE. Comfy прямо рекомендует INT8 + tiled decode для длинных песен на картах с нищебродской VRAM.
Скорость
140 секунд музыки за примерно 125 секунд генерации в r/comfyui. То есть примерно около realtime(!!!!).
Очень круто: длительность не абсолютно жесткая. У MiniMax авторегрессионная часть умеет выдать end-of-audio раньше лимита. В API
Плюсы:
- вокал заметно лучше большинства предыдущих локальных/open моделей
- композиции действительно похожи на законченные песни, а не на двухминутные бесконечные лупы
- длинная структура держится прилично
Минусы:
Пока это в основном Text-to-Music.
Нет нормального:
- audio reference
- song-to-song
- cover/remix существующего трека
- extend собственного аудио
- replace section/inpaint
- reference style через загруженный трек.
И непонятки с обучением.
А вот с промптами все нарядно - Structured Caption из трех частей:
1. Global Metadata - жанр, subgenre, BPM, key, scale, эмоциональная дуга, production profile.
2. Vocal Details - пол, тембр, манера, backing vocals, harmonies, эффекты.
3. Arrangement - инструменты, развитие по секциям, groove, bass, percussion, spatial FX.
И отдельно lyrics с секционными тегами.
Ссылки:
https://docs.comfy.org/tutorials/audio/minimax/minimax-music-3
https://huggingface.co/MiniMaxAI/MiniMax-Music3
https://huggingface.co/Comfy-Org/MiniMax-Music-3
https://github.com/Comfy-Org/workflow_templates/blob/main/templates/audio_minimax_music_3.json
https://github.com/Comfy-Org/ComfyUI/pull/15570
https://www.reddit.com/r/comfyui/comments/1vni9fq/minimax_music_3_is_live_in_comfyui_enjoy_state_of/
@cgevent
Музыкальная тема не отпускает, будем жечь дальше, хотя там вышла Gemini 3.7 Flash и GLM 5.3
Их позже обсудим.
Для ботов: ACE < Minimax < Suno.
Для тех, кто физическим не может в длинные тексты: MiniMax Music 3 - новая локальная open-weight модель, которая уже завелась в ComfyUI и умеет генерировать длинные полноценные песни с вокалом. Под капотом гибрид: 8B LLM на базе Qwen3-8B держит структуру трека, 0.6B LLM занимается локальными деталями, а Flow Matching + Flow-VAE превращают это в аудио.
Теперь для гиков.
Технически MiniMax Music 3 устроен заметно интереснее обычных audio-token моделей. Под капотом гибридная схема: 8B LLM на базе Qwen3-8B отвечает за длинную структуру трека, развитие куплетов, припевов и общую музыкальную логику; отдельный 0.6B LLM дорисовывает более локальные, покадровые акустические детали. После этого звук не декодируется напрямую из токенов: объединенные hidden states идут в 2.4B Flow Matching-модуль + Flow-VAE, которые уже синтезируют финальное аудио.
Уже есть поддержка ComfyUI
Официальный workflow MiniMax Music 3 сейчас выводит такие основные параметры:
-
Caption - стиль, BPM, тональность, вокал, инструменты, аранжировка-
Lyrics - текст + структурные теги [Intro], [Verse], [Chorus], [Bridge], [Solo], [Outro] и т.д.-
max_duration - длительность, до примерно 300 секунд- `seed` - есть.
-
tiled_decode - экономия VRAM при декодировании длинных треков.Самое главное: железо
Не так все плохо, однако.
MiniMax официально пишет:
- full precision помещается менее чем в 24 GB VRAM
- с automatic CPU offload расход GPU около 22 GB
- с layer-by-layer streaming можно запустить даже на 8 GB VRAM, но заметно медленнее.
Для ComfyUI уже есть три чекпойнта(на момент написания):
-
minimax_music3_dit_fp16.safetensors-
minimax_music3_dit_int8_convrot.safetensors-
minimax_music3_text_encoder_pruned_int8_convrot.safetensorsПлюс отдельный VAE. Comfy прямо рекомендует INT8 + tiled decode для длинных песен на картах с нищебродской VRAM.
Скорость
140 секунд музыки за примерно 125 секунд генерации в r/comfyui. То есть примерно около realtime(!!!!).
Очень круто: длительность не абсолютно жесткая. У MiniMax авторегрессионная часть умеет выдать end-of-audio раньше лимита. В API
max_new_tokens ограничивает максимум аудиофреймов, причем модель может закончить песню раньше. В ComfyUI max_duration работает аналогично как целевая/максимальная длительность. Плюсы:
- вокал заметно лучше большинства предыдущих локальных/open моделей
- композиции действительно похожи на законченные песни, а не на двухминутные бесконечные лупы
- длинная структура держится прилично
Минусы:
Пока это в основном Text-to-Music.
Нет нормального:
- audio reference
- song-to-song
- cover/remix существующего трека
- extend собственного аудио
- replace section/inpaint
- reference style через загруженный трек.
И непонятки с обучением.
А вот с промптами все нарядно - Structured Caption из трех частей:
1. Global Metadata - жанр, subgenre, BPM, key, scale, эмоциональная дуга, production profile.
2. Vocal Details - пол, тембр, манера, backing vocals, harmonies, эффекты.
3. Arrangement - инструменты, развитие по секциям, groove, bass, percussion, spatial FX.
И отдельно lyrics с секционными тегами.
Ссылки:
https://docs.comfy.org/tutorials/audio/minimax/minimax-music-3
https://huggingface.co/MiniMaxAI/MiniMax-Music3
https://huggingface.co/Comfy-Org/MiniMax-Music-3
https://github.com/Comfy-Org/workflow_templates/blob/main/templates/audio_minimax_music_3.json
https://github.com/Comfy-Org/ComfyUI/pull/15570
https://www.reddit.com/r/comfyui/comments/1vni9fq/minimax_music_3_is_live_in_comfyui_enjoy_state_of/
@cgevent
👍33🔥11❤10👎3🙏1
Для конченых гиков
MiniMax Music 3 в ComfyUI сейчас фактически дает два уровня генерации:
AR: seed + CFG + top_k + duration
↓
hidden representation песни
↓
Flow/DiT: seed + steps + CFG + sampler + scheduler
↓
DAV/Flow-VAE
↓
audio
Temperature/top_p пока отсутствуют, но это именно недостающие 10-30 строк sampling-кода, а не ограничение весов.
Главное: официальный workflow связывает AR seed и DiT seed одним SeedNode.
И в принципе seed и CFG можно развязать.
Типа
AR seed: 12345
DiT seed: 67890
Также:
AR CFG 2.5 + DiT CFG 1.0
и
AR CFG 1.0 + DiT CFG 2.5
Могут звучать сильно по разному.
Но это уже дебри...
@cgevent
MiniMax Music 3 в ComfyUI сейчас фактически дает два уровня генерации:
AR: seed + CFG + top_k + duration
↓
hidden representation песни
↓
Flow/DiT: seed + steps + CFG + sampler + scheduler
↓
DAV/Flow-VAE
↓
audio
Temperature/top_p пока отсутствуют, но это именно недостающие 10-30 строк sampling-кода, а не ограничение весов.
Главное: официальный workflow связывает AR seed и DiT seed одним SeedNode.
И в принципе seed и CFG можно развязать.
Типа
AR seed: 12345
DiT seed: 67890
Также:
AR CFG 2.5 + DiT CFG 1.0
и
AR CFG 1.0 + DiT CFG 2.5
Могут звучать сильно по разному.
Но это уже дебри...
@cgevent
👎7❤5👍3😱3
Media is too big
VIEW IN TELEGRAM
Замузыку. Заумные мысли
Я вот гляжу на новый Suno Studio 2, и странное чудится мне.
Сейчас приведу аналогию с видеогенераторами, ибо некоторые из которых пыжатся изо всех сил, чтобы стать новым Премьером или Резолвом. Монтажка, таймлайн (в браузере это адъ), эффекты, переходы.
В веб-монтаже нет никакого смысла, потому что на итоге юзеры понесут свой результат в Премьер, Афтер, ДаВинчи. Точно также как уносят картинки в Фотошоп для доводки.
И в этом смысле горазд важнее, что можно подавать на вход в генератор, а не что получать на выходе. Максимальное разнообразие на входе, и унифицированный выход, идущий в монтажку\фотошоп.
Чего хочется от генераторов: разборка на слои\стемы, редактирующие возможности (не в смысле монтажа, а в плане регенерации\инпайнта\екстенда\заполнения), послойная регенерация. И в этом смысле процесс идет. И таймлайн тут нужен для контроля генераций, а не для монтажа.
А вот замашки на DAW\монтаж\эффекты можно пропустить.
Ну и конечно, управляемость. И в этом смысле показателен следующий пост из коментов.
@cgevent
Я вот гляжу на новый Suno Studio 2, и странное чудится мне.
Сейчас приведу аналогию с видеогенераторами, ибо некоторые из которых пыжатся изо всех сил, чтобы стать новым Премьером или Резолвом. Монтажка, таймлайн (в браузере это адъ), эффекты, переходы.
В веб-монтаже нет никакого смысла, потому что на итоге юзеры понесут свой результат в Премьер, Афтер, ДаВинчи. Точно также как уносят картинки в Фотошоп для доводки.
И в этом смысле горазд важнее, что можно подавать на вход в генератор, а не что получать на выходе. Максимальное разнообразие на входе, и унифицированный выход, идущий в монтажку\фотошоп.
Чего хочется от генераторов: разборка на слои\стемы, редактирующие возможности (не в смысле монтажа, а в плане регенерации\инпайнта\екстенда\заполнения), послойная регенерация. И в этом смысле процесс идет. И таймлайн тут нужен для контроля генераций, а не для монтажа.
А вот замашки на DAW\монтаж\эффекты можно пропустить.
Ну и конечно, управляемость. И в этом смысле показателен следующий пост из коментов.
@cgevent
👍19❤6👎3
Audio
Кому в Требло?
Приведу вот такой такой пост из коментов от Александра. Он обозначает довольно интересные плюсы Treblo и минусы Suno. Очень любопытно, особенно про датасеты.
На днях стало интересно проверить, насколько у них (Требло) реально большая база.
Спарсил список из 35 000 исполнителей по 6 странам (брал топы из last.fm, строго в порядке убывания популярности). По косвенным признакам понял, что метаданные для обучения они тянули из MusicBrainz. Сопоставил списки, чтобы вытащить все возможные варианты написания. Написал скрипт и аккуратно прогнал всю эту базу через их валидатор.
По цифрам: из 35 000 артистов валидацию успешно прошли около 15 000. База действительно огромная. Даже когда скрипт дошел до самого конца списка и проверял глубокий андеграунд, процент узнавания держался в районе 40%. Судя по наличию одних артистов и отсутствию других, сам датасет они собирали где-то в 2022–2023 годах.
Русскоговорящих исполнителей там сильно меньше, чем западных. Если из топа США пробивается около 90% имен, то из нашего сегмента от силы 30%.
Но у такого гигантского датасета есть крутое преимущество. В отличие от Suno, у которого большинство треков страдает от одинакового мастеринга и шаблонных тембров, Treblo выдает сумасшедшее разнообразие в звучании. Этим платформа очень напоминает ранние версии Udio. Если правильно подобрать теги, можно вытащить всё что угодно: хоть хор балканских бабушек, хоть ритуальные богослужения (в Suno такое получить практически нереально).
Правда, из-за такой всеядности и огромной базы нейронка гораздо чаще ловит звуковые артефакты и галлюцинации.
Но за пределами моего списка лежат еще десятки тысяч рок-групп, финских метал-бэндов, блюзменов из 30-х годов и аниме-композиторов, чьи альбомы когда-то были выгружены в сеть и размечены в MusicBrainz. Так что, не удивлюсь, если количество артистов в их базе переваливает за 50 000.
P.S. Вообще, учитывая, как бескомпромиссно они сожрали гигантские объемы защищенного копирайтом контента, ребята ходят по очень тонкой грани.
P.P.S. Я не говорил, что Suno в принципе не может сгенерировать хор как таковой или какой-нибудь специфический жанр.
Речь о том, что он очень скуден тембрально и текстурно. Suno выдает дистиллированный, прилизанный звук. У него всё звучит так, будто это записано в 2010/20-х на одной и той же аппаратуре.
Грубо говоря, если попросить Suno написать гранж в стиле Nirvana, это будет звучать так, словно Курта Кобейна загнали в современную студию, дали новенькие блестящие инструменты из магазина, а сводил всё это дело модный поп-продюсер из 2010-х. А сразу за Нирваной в очереди в эту же студию стоят те самые балканские бабушки, чтобы записаться в тот же микрофон. Звучать они в итоге будут так же стерильно, как бэк-вокалистки Дуа Липы. Нет грязи, нет аутентичности пространства и времени.
Примеры (текст просто эхолалия под языки тех регионов, смысла в нём нет):
1.mp3 Балканский хор. У Treblo слышна аутентичность региона, специфическое звукоизвлечение и народное пространство. Suno, возможно, взял бы специфичные для региона гармонии и узкое звукоизвлечение, но на этом всё.
2.mp3 Биг-бэнд в стиле 50-х. Звук похож на запись 50-х, с нужной сатурацией и артефактами, которая записана на оборудовании 50-х и снята с оригинальных носителей. В Suno такого винтажа не добиться, модель всё равно попытается сделать звук чистым и современным, максимум, искусственно добавит треск пластинки. Она возьмёт структуру, инструменты и аранжировки из 50-х, но звучать это будет как современный Big Band.
3.mp3 Африканский хор. Очень крутая детализация, там слышно характерное пощелкивание языков и артикуляцию. Suno бы свёл африканский хор к американскому госпелу.
В общем, в Suno хор получится масштабным, но это будет скорее универсальный хор из голливудского трейлера с щепоткой каких-то вариативных характеристик. При этом я ни в коем случае не хочу сказать, что Suno плохой, а Treblo хороший. Они оба крутые. Просто Suno больше заточен под современный коммерческий продакшен и аранжировки, а Treblo лучше справляется с аутентичной фактурой
@cgevent
Приведу вот такой такой пост из коментов от Александра. Он обозначает довольно интересные плюсы Treblo и минусы Suno. Очень любопытно, особенно про датасеты.
На днях стало интересно проверить, насколько у них (Требло) реально большая база.
Спарсил список из 35 000 исполнителей по 6 странам (брал топы из last.fm, строго в порядке убывания популярности). По косвенным признакам понял, что метаданные для обучения они тянули из MusicBrainz. Сопоставил списки, чтобы вытащить все возможные варианты написания. Написал скрипт и аккуратно прогнал всю эту базу через их валидатор.
По цифрам: из 35 000 артистов валидацию успешно прошли около 15 000. База действительно огромная. Даже когда скрипт дошел до самого конца списка и проверял глубокий андеграунд, процент узнавания держался в районе 40%. Судя по наличию одних артистов и отсутствию других, сам датасет они собирали где-то в 2022–2023 годах.
Русскоговорящих исполнителей там сильно меньше, чем западных. Если из топа США пробивается около 90% имен, то из нашего сегмента от силы 30%.
Но у такого гигантского датасета есть крутое преимущество. В отличие от Suno, у которого большинство треков страдает от одинакового мастеринга и шаблонных тембров, Treblo выдает сумасшедшее разнообразие в звучании. Этим платформа очень напоминает ранние версии Udio. Если правильно подобрать теги, можно вытащить всё что угодно: хоть хор балканских бабушек, хоть ритуальные богослужения (в Suno такое получить практически нереально).
Правда, из-за такой всеядности и огромной базы нейронка гораздо чаще ловит звуковые артефакты и галлюцинации.
Но за пределами моего списка лежат еще десятки тысяч рок-групп, финских метал-бэндов, блюзменов из 30-х годов и аниме-композиторов, чьи альбомы когда-то были выгружены в сеть и размечены в MusicBrainz. Так что, не удивлюсь, если количество артистов в их базе переваливает за 50 000.
P.S. Вообще, учитывая, как бескомпромиссно они сожрали гигантские объемы защищенного копирайтом контента, ребята ходят по очень тонкой грани.
P.P.S. Я не говорил, что Suno в принципе не может сгенерировать хор как таковой или какой-нибудь специфический жанр.
Речь о том, что он очень скуден тембрально и текстурно. Suno выдает дистиллированный, прилизанный звук. У него всё звучит так, будто это записано в 2010/20-х на одной и той же аппаратуре.
Грубо говоря, если попросить Suno написать гранж в стиле Nirvana, это будет звучать так, словно Курта Кобейна загнали в современную студию, дали новенькие блестящие инструменты из магазина, а сводил всё это дело модный поп-продюсер из 2010-х. А сразу за Нирваной в очереди в эту же студию стоят те самые балканские бабушки, чтобы записаться в тот же микрофон. Звучать они в итоге будут так же стерильно, как бэк-вокалистки Дуа Липы. Нет грязи, нет аутентичности пространства и времени.
Примеры (текст просто эхолалия под языки тех регионов, смысла в нём нет):
1.mp3 Балканский хор. У Treblo слышна аутентичность региона, специфическое звукоизвлечение и народное пространство. Suno, возможно, взял бы специфичные для региона гармонии и узкое звукоизвлечение, но на этом всё.
2.mp3 Биг-бэнд в стиле 50-х. Звук похож на запись 50-х, с нужной сатурацией и артефактами, которая записана на оборудовании 50-х и снята с оригинальных носителей. В Suno такого винтажа не добиться, модель всё равно попытается сделать звук чистым и современным, максимум, искусственно добавит треск пластинки. Она возьмёт структуру, инструменты и аранжировки из 50-х, но звучать это будет как современный Big Band.
3.mp3 Африканский хор. Очень крутая детализация, там слышно характерное пощелкивание языков и артикуляцию. Suno бы свёл африканский хор к американскому госпелу.
В общем, в Suno хор получится масштабным, но это будет скорее универсальный хор из голливудского трейлера с щепоткой каких-то вариативных характеристик. При этом я ни в коем случае не хочу сказать, что Suno плохой, а Treblo хороший. Они оба крутые. Просто Suno больше заточен под современный коммерческий продакшен и аранжировки, а Treblo лучше справляется с аутентичной фактурой
@cgevent
👍29❤18👎12🔥9😁6
Forwarded from AI Product | Igor Akimov
Google выкатил Gemini 3.7 Flash
Их прорвало что ли? Или летние нагрузки меньшие освободили GPU для тренинга?
– Цена не изменилась: $0.75 / $3.75 за 1M токенов. Для сравнения: Claude Sonnet 5 – $2 / $10, GPT-5.6 Terra – $2 / $12 (он типа круче Луны) То есть Flash в 2.5–3 раза дешевле конкурентов. Но это промо-цена до конца 2026. С января – $1.50 / $7.50. Хах, тут каждые 2 недели выходят новые модели, а они рассказывают, что будет через 5 месяцев :)
– FrontierCode 43.6% – лучший результат среди всех, включая Sonnet 5 и GPT-5.6. Огоняет флагманы конкурентов в production-коде
– AutomationBench (автоматизация enterprise-процессов): 30.4% против 10.7% у Sonnet 5
– Длинный контекст: 97% на MRCR при 128k.
– Понимание PDF (GDP.pdf): 34% – тоже лучший результат, хотя абсолютные цифры показывают, что до "решённой задачи" всем ещё далеко
Слабые места тоже есть: агентские задачи (Terminal-bench 3.0, OSWorld) – GPT-5.6 заметно впереди, а в знаниевой работе (GDPVal) лидирует Muse Spark.
Короче, перейти с 3.5/3.6 наверное стоит после тестов, для больших доков, обработок и кодовых баз должно быть норм.
https://deepmind.google/models/model-cards/gemini-3-7-flash/
Их прорвало что ли? Или летние нагрузки меньшие освободили GPU для тренинга?
– Цена не изменилась: $0.75 / $3.75 за 1M токенов. Для сравнения: Claude Sonnet 5 – $2 / $10, GPT-5.6 Terra – $2 / $12 (он типа круче Луны) То есть Flash в 2.5–3 раза дешевле конкурентов. Но это промо-цена до конца 2026. С января – $1.50 / $7.50. Хах, тут каждые 2 недели выходят новые модели, а они рассказывают, что будет через 5 месяцев :)
– FrontierCode 43.6% – лучший результат среди всех, включая Sonnet 5 и GPT-5.6. Огоняет флагманы конкурентов в production-коде
– AutomationBench (автоматизация enterprise-процессов): 30.4% против 10.7% у Sonnet 5
– Длинный контекст: 97% на MRCR при 128k.
– Понимание PDF (GDP.pdf): 34% – тоже лучший результат, хотя абсолютные цифры показывают, что до "решённой задачи" всем ещё далеко
Слабые места тоже есть: агентские задачи (Terminal-bench 3.0, OSWorld) – GPT-5.6 заметно впереди, а в знаниевой работе (GDPVal) лидирует Muse Spark.
Короче, перейти с 3.5/3.6 наверное стоит после тестов, для больших доков, обработок и кодовых баз должно быть норм.
https://deepmind.google/models/model-cards/gemini-3-7-flash/
👎18👍12❤6😁2
Forwarded from Neural Shit
This media is not supported in your browser
VIEW IN TELEGRAM
1😁148👎8😱7❤4👍2🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Вы будете смеяцца, но у нас новый видео генератор.
И это просто конский монстр. По сравнению с ним Минимакс - это Stable Diffusion 1.5 на два килобайта.
Итак MAGI-2 Preview - открытая unified audio-video модель на 114B параметров, построенная как очень мелкозернистый MoE. Единовременно активируется около 6B параметров, то есть примерно 5% всей ёмкости модели. Sand AI называет это Ultra-Fine-Grained MoE / MagiMoE.
Модель одновременно работает с текстом, видео и аудио в одном Transformer backbone.
Сейчас заявлены T2V и I2V, причём звук генерируется совместно с изображением, а не приклеивается отдельной моделью после генерации. Выход пока жёстко ограничен 10 секундами. Референсов и редактирования нет.
Генерация двухступенчатая:
- base/preview: 512 × 896
- refiner: 1088 × 1920
- затем при необходимости output ресайзится до настоящих 1080 × 1920.
А теперь праздник: системные требования
Официальный MINIMUM(!):
8 × NVIDIA Hopper GPU.
Типа 8×H100/H200. Общий размер весов - около 307 GB:
- main preview transformer - 228 GB
- Qwen3.5-27B text encoder - 56 GB
- refiner - 14 GB
- Stable Audio Open audio VAE - 5 GB
- Wan 2.2 video VAE - 3 GB
- Turbo VAE decoder - 2 GB.
То есть полный зоопарк - особенно напрягает Stable Audio и древний ВАН.
По счастию Монстр уже есть на Artificial Analysis.
И среди open-weight video models with audio сейчас картина такая:
1. MiniMax H3 - 1192
2. MAGI-2 Preview - 1108
3. LTX-2.3 Fast - 958
Наверное можно расходиться, но впереди еще MAGI-2 distilled, которой нет.
Ну и надо подсобрать тесты, пока мало примеров.
А теперь самое главное - дешевая цена (в облаке):
MAGI-2 Preview теоретически обходится Sand.ai примерно в $0.074 за 10 секунд 1080p, но официальную пользовательскую цену API за такой ролик Sand.ai публично не раскрывает. Более того, по идее это цена за distilled модель, которой пока нет.
Cсылки:
https://platform.sand.ai/
https://platform.sand.ai/docs/api-v2
https://platform.sand.ai/app/buy-credits
https://sand.ai/blog/magi-2-preview
https://github.com/SandAI-org/MAGI-2-preview
https://huggingface.co/sand-ai/MAGI-2-preview
https://artificialanalysis.ai/video/leaderboard/image-to-video
@cgevent
И это просто конский монстр. По сравнению с ним Минимакс - это Stable Diffusion 1.5 на два килобайта.
Итак MAGI-2 Preview - открытая unified audio-video модель на 114B параметров, построенная как очень мелкозернистый MoE. Единовременно активируется около 6B параметров, то есть примерно 5% всей ёмкости модели. Sand AI называет это Ultra-Fine-Grained MoE / MagiMoE.
Модель одновременно работает с текстом, видео и аудио в одном Transformer backbone.
Главная архитектурная фишка интереснее самого числа 114B. Backbone - **40 Transformer layers**, из них средние **36 слоёв MoE**, четыре крайних dense. Hidden width 3072 разбивается на **12 независимых head по 256 dimensions**. У каждого head собственный набор из **256 экспертов**, а на токен выбираются Top-6. То есть на одном MoE-слое потенциально существует 12 × 256 = **3072 маленьких expert-блоков**, но конкретный токен использует всего 72 из них. Это позволяет хранить огромное количество специализированных параметров, не прогоняя 114B целиком на каждом diffusion step.
Сейчас заявлены T2V и I2V, причём звук генерируется совместно с изображением, а не приклеивается отдельной моделью после генерации. Выход пока жёстко ограничен 10 секундами. Референсов и редактирования нет.
Генерация двухступенчатая:
- base/preview: 512 × 896
- refiner: 1088 × 1920
- затем при необходимости output ресайзится до настоящих 1080 × 1920.
А теперь праздник: системные требования
Официальный MINIMUM(!):
8 × NVIDIA Hopper GPU.
Типа 8×H100/H200. Общий размер весов - около 307 GB:
- main preview transformer - 228 GB
- Qwen3.5-27B text encoder - 56 GB
- refiner - 14 GB
- Stable Audio Open audio VAE - 5 GB
- Wan 2.2 video VAE - 3 GB
- Turbo VAE decoder - 2 GB.
То есть полный зоопарк - особенно напрягает Stable Audio и древний ВАН.
По счастию Монстр уже есть на Artificial Analysis.
И среди open-weight video models with audio сейчас картина такая:
1. MiniMax H3 - 1192
2. MAGI-2 Preview - 1108
3. LTX-2.3 Fast - 958
Наверное можно расходиться, но впереди еще MAGI-2 distilled, которой нет.
Ну и надо подсобрать тесты, пока мало примеров.
А теперь самое главное - дешевая цена (в облаке):
MAGI-2 Preview теоретически обходится Sand.ai примерно в $0.074 за 10 секунд 1080p, но официальную пользовательскую цену API за такой ролик Sand.ai публично не раскрывает. Более того, по идее это цена за distilled модель, которой пока нет.
Cсылки:
https://platform.sand.ai/
https://platform.sand.ai/docs/api-v2
https://platform.sand.ai/app/buy-credits
https://sand.ai/blog/magi-2-preview
https://github.com/SandAI-org/MAGI-2-preview
https://huggingface.co/sand-ai/MAGI-2-preview
https://artificialanalysis.ai/video/leaderboard/image-to-video
@cgevent
😁27🔥14👎9❤7👍4😱1
Please open Telegram to view this post
VIEW IN TELEGRAM
😱24👎5🔥4❤1👍1
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка
«Супер-Дружба»
Автор: @Sergei_108
Мульт про ёжика Соника в стиле Pixar. Делал специально ко дню рождения 7-милетних племянников, с их участием в мульте. Это был первый опыт создания видео с сюжетом и героями. Понимаю, что ролик далёк от идеала).
Консистентность персонажей немного плывёт, но для детей это непринципиально)
Делал в марте и начале апреля. В основном Клинг 2.5 Турбо, Сиданс в открытый доступ только вышел и две сложные сцены по 15 сек. хотел сделать через него, но он упорно не хотел генерить сцены с Соником, даже по текстовому описанию. Пришлось делать в Клинге и потом склеивать до 15 секунд сцены.
Пайплайн:
0. Создание карт персонажей Соника, Сони и Никиты на основе их фото в Nano Banana 2.
1. Сценарий в Qwen.
2. Раскадровка Nano Banana 2.
3. Промпты для видео Claude Opus.
3. Анимация Kling 2.5 Turbo.
4. Голоса реальные, клонированные через kikivoice: мой, Соника (взял для клонирования голос самого популярного актёра, который дублировал Соника, Михаил Тихонов), племянников: Сони и Никиты, Др. Роботника.
5. Стихи для песни написал Gemini.
6. Песня и музыка в Suno 5.5.
7. Монтаж и фоновые звуки CapCut.
Понимаю, что достаточно сыро и криво, но это был первый опыт. Родителям племянников зашло даже больше, а у племянников была неоднозначная реакция, когда им это показали в лоб без предварительного объяснения: они стали оценивать и сравнивать со своей внешностью, стали говорить: типа у меня не такие волосы, голос и тп. В итоге мальчик не смог принять, а девочка сказала, что ей понравилось.
Стоимость: чуть больше 3тр на подписку Клинг и токенов в Syntx.
Сроки: делал полтора месяца в свободное время.
@cgevent
«Супер-Дружба»
Автор: @Sergei_108
Мульт про ёжика Соника в стиле Pixar. Делал специально ко дню рождения 7-милетних племянников, с их участием в мульте. Это был первый опыт создания видео с сюжетом и героями. Понимаю, что ролик далёк от идеала).
Консистентность персонажей немного плывёт, но для детей это непринципиально)
Делал в марте и начале апреля. В основном Клинг 2.5 Турбо, Сиданс в открытый доступ только вышел и две сложные сцены по 15 сек. хотел сделать через него, но он упорно не хотел генерить сцены с Соником, даже по текстовому описанию. Пришлось делать в Клинге и потом склеивать до 15 секунд сцены.
Пайплайн:
0. Создание карт персонажей Соника, Сони и Никиты на основе их фото в Nano Banana 2.
1. Сценарий в Qwen.
2. Раскадровка Nano Banana 2.
3. Промпты для видео Claude Opus.
3. Анимация Kling 2.5 Turbo.
4. Голоса реальные, клонированные через kikivoice: мой, Соника (взял для клонирования голос самого популярного актёра, который дублировал Соника, Михаил Тихонов), племянников: Сони и Никиты, Др. Роботника.
5. Стихи для песни написал Gemini.
6. Песня и музыка в Suno 5.5.
7. Монтаж и фоновые звуки CapCut.
Понимаю, что достаточно сыро и криво, но это был первый опыт. Родителям племянников зашло даже больше, а у племянников была неоднозначная реакция, когда им это показали в лоб без предварительного объяснения: они стали оценивать и сравнивать со своей внешностью, стали говорить: типа у меня не такие волосы, голос и тп. В итоге мальчик не смог принять, а девочка сказала, что ей понравилось.
Стоимость: чуть больше 3тр на подписку Клинг и токенов в Syntx.
Сроки: делал полтора месяца в свободное время.
@cgevent
👎58👍18❤7😁7🔥6🙏3
Media is too big
VIEW IN TELEGRAM
Pika Music
Минимакс покусал Пику, она запустила собственное семейство аудиомоделей, и самая интересная тут(для меня) Pika Music - типаполноценный генератор песен в духе Suno/MiniMax Music.
Все по моде. На вход можно дать обычный промпт, свой текст песни, референс голоса, музыкальный референс или всё это одновременно. На выходе - законченный трек длительностью до 6 минут. Pika утверждает, что 90-секундный трек модель генерирует в среднем за 6.21 секунды, примерно в 14.5 раза быстрее реального времени.
Главный прикол - цена: $0.015 за минуту музыки. То есть 4-минутная песня стоит примерно 6 центов, шестиминутная - 9 центов. Pika заявляет, что Music получается до 10 раз дешевле "сопоставимых" музыкальных моделей. Пока модель доступна только через Pika API Club, но там уже есть нормальный веб-Playground, Заодно Pika выпустила Soundtrack, SFX и Speech
Тут пробуем:
https://dev.pika.art/models/pika/pika-audio/pika-music/playground
Тут примеры:
https://experiment.pika.art/blog/pika-audio-models
@cgevent
Минимакс покусал Пику, она запустила собственное семейство аудиомоделей, и самая интересная тут(для меня) Pika Music - типаполноценный генератор песен в духе Suno/MiniMax Music.
Все по моде. На вход можно дать обычный промпт, свой текст песни, референс голоса, музыкальный референс или всё это одновременно. На выходе - законченный трек длительностью до 6 минут. Pika утверждает, что 90-секундный трек модель генерирует в среднем за 6.21 секунды, примерно в 14.5 раза быстрее реального времени.
Главный прикол - цена: $0.015 за минуту музыки. То есть 4-минутная песня стоит примерно 6 центов, шестиминутная - 9 центов. Pika заявляет, что Music получается до 10 раз дешевле "сопоставимых" музыкальных моделей. Пока модель доступна только через Pika API Club, но там уже есть нормальный веб-Playground, Заодно Pika выпустила Soundtrack, SFX и Speech
Тут пробуем:
https://dev.pika.art/models/pika/pika-audio/pika-music/playground
Тут примеры:
https://experiment.pika.art/blog/pika-audio-models
@cgevent
❤27👍23🔥11👎3😱2
This media is not supported in your browser
VIEW IN TELEGRAM
MiniMax H3 - длинные видосы. Для гиков.
Сразу два проекта пытаются сделать очень ловкий продолжатор:
H3 Motion Context и H3 Continuum.
Оба пришли к одной правильной идее: хватит декодировать последний кадр в картинку, снова запихивать его через VAE и надеяться, что лицо, одежда, цвет и движение не поплывут. Вместо этого следующий кусок получает сырой video+audio latent предыдущего. Motion Context по умолчанию переносит последние 22 видеокадра и отдельно 24 кадра аудиоконтекста (ровно 1 с), после чего повторившийся кусок автоматически отрезается. Авторы особенно заморочились со звуком:
аудио помещается именно в предыдущую часть таймлайна, а не подаётся как обычный reference.
Motion Context - более компактный и типа более педантичный инструмент именно для бесшовного продолжения одного дубля. Уже есть Ref2VA, сохранение references и стресс-тест на 16 клипов / 4:34 видео на RTX 5070 Ti. Но автор советует не включать Spectrum: прогнозирование transformer steps может портить pinned latent context, особенно звук. Turbo тоже работает, но чем агрессивнее ускорение, тем хуже continuity. То есть идея здесь простая: сначала не сломать временную непрерыность, потом уже думать, как ее ускорять.
H3 Continuum 3.3 идёт гораздо дальше и превращает эту идею в production-систему. Он автоматически генерирует до 16 связанных чанков, умеет T2VA/I2VA/FL2VA/Ref2VA, держит до трёх reference images, reference audio, отдельные prompts для каждого участка и Timeline Video conditioning. Есть автоматическое сохранение каждого raw AV latent, Resume после падения и "Regenerate From Chunk N", поэтому ради неудачного 40-го секунды не приходится пересчитывать всю минуту. Со Spectrum здесь, наоборот, все шиштяк: на каждом новом стыке первые два transformer evaluations обязательно считает настоящий H3, и только затем Spectrum начинает прогнозировать шаги. Поэтому рекомендуемый quality-режим - около 20 steps + Spectrum, speed-режим - Turbo 8-step без Spectrum. Turbo + Spectrum пока считается экспериментом.
На итоге:
Motion Context - для максимально чистого непрерывного дубля, особенно с речью или музыкой.
Continuum - для производства длинных 30-80-секундных сцен, где нужны персонажи, references, таймлайн, восстановление после падения и нормальное управление десятком генераций.
Ссылки:
H3 Motion Context
https://github.com/NikoDemon80/ComfyUI-H3-Motion-Context
Motion Context MultiRef
https://github.com/seitanism/ComfyUI-H3-Motion-Context-MultiRef
H3 Continuum
https://github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum
Реддит тред Motion Context
https://www.reddit.com/r/StableDiffusion/comments/1vhppmv/clip_chaining_for_minimax_h3_motion_and_audio/
Motion Context v0.2 / Ref2VA
https://www.reddit.com/r/StableDiffusion/comments/1vjvx4l/h3_motion_context_v020_reference_mode_support_and/
@cgevent
Сразу два проекта пытаются сделать очень ловкий продолжатор:
H3 Motion Context и H3 Continuum.
Оба пришли к одной правильной идее: хватит декодировать последний кадр в картинку, снова запихивать его через VAE и надеяться, что лицо, одежда, цвет и движение не поплывут. Вместо этого следующий кусок получает сырой video+audio latent предыдущего. Motion Context по умолчанию переносит последние 22 видеокадра и отдельно 24 кадра аудиоконтекста (ровно 1 с), после чего повторившийся кусок автоматически отрезается. Авторы особенно заморочились со звуком:
аудио помещается именно в предыдущую часть таймлайна, а не подаётся как обычный reference.
Motion Context - более компактный и типа более педантичный инструмент именно для бесшовного продолжения одного дубля. Уже есть Ref2VA, сохранение references и стресс-тест на 16 клипов / 4:34 видео на RTX 5070 Ti. Но автор советует не включать Spectrum: прогнозирование transformer steps может портить pinned latent context, особенно звук. Turbo тоже работает, но чем агрессивнее ускорение, тем хуже continuity. То есть идея здесь простая: сначала не сломать временную непрерыность, потом уже думать, как ее ускорять.
H3 Continuum 3.3 идёт гораздо дальше и превращает эту идею в production-систему. Он автоматически генерирует до 16 связанных чанков, умеет T2VA/I2VA/FL2VA/Ref2VA, держит до трёх reference images, reference audio, отдельные prompts для каждого участка и Timeline Video conditioning. Есть автоматическое сохранение каждого raw AV latent, Resume после падения и "Regenerate From Chunk N", поэтому ради неудачного 40-го секунды не приходится пересчитывать всю минуту. Со Spectrum здесь, наоборот, все шиштяк: на каждом новом стыке первые два transformer evaluations обязательно считает настоящий H3, и только затем Spectrum начинает прогнозировать шаги. Поэтому рекомендуемый quality-режим - около 20 steps + Spectrum, speed-режим - Turbo 8-step без Spectrum. Turbo + Spectrum пока считается экспериментом.
На итоге:
Motion Context - для максимально чистого непрерывного дубля, особенно с речью или музыкой.
Continuum - для производства длинных 30-80-секундных сцен, где нужны персонажи, references, таймлайн, восстановление после падения и нормальное управление десятком генераций.
Ссылки:
H3 Motion Context
https://github.com/NikoDemon80/ComfyUI-H3-Motion-Context
Motion Context MultiRef
https://github.com/seitanism/ComfyUI-H3-Motion-Context-MultiRef
H3 Continuum
https://github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum
Реддит тред Motion Context
https://www.reddit.com/r/StableDiffusion/comments/1vhppmv/clip_chaining_for_minimax_h3_motion_and_audio/
Motion Context v0.2 / Ref2VA
https://www.reddit.com/r/StableDiffusion/comments/1vjvx4l/h3_motion_context_v020_reference_mode_support_and/
@cgevent
🔥22❤20👍5👎2🙏1
This media is not supported in your browser
VIEW IN TELEGRAM
Убежать не удасца. По крайней мере на кожаных ногах
Unitree тизерит нового робата, который при длине ноги всего 85 см разгоняется до 12.66 м/с - это 45.6 км/ч - и прыгает с места на 2 метра вверх.
Самое неприятное для кожаных: Unitree утверждает, что эту штуку разрабатывают чуть больше трех месяцев.
12.66 м/с - примерно темп стометровки за 7.9 секунды, если бы тварь могла держать максималку всю дистанцию...
И запрыгивать они будут прямо к вам в окна.
@cgevent
Unitree тизерит нового робата, который при длине ноги всего 85 см разгоняется до 12.66 м/с - это 45.6 км/ч - и прыгает с места на 2 метра вверх.
Самое неприятное для кожаных: Unitree утверждает, что эту штуку разрабатывают чуть больше трех месяцев.
12.66 м/с - примерно темп стометровки за 7.9 секунды, если бы тварь могла держать максималку всю дистанцию...
И запрыгивать они будут прямо к вам в окна.
@cgevent
😁52😱19🔥9👍5❤1👎1