Media is too big
VIEW IN TELEGRAM
🚀 RUKALLAMA: ВСЕ ВОПРОСЫ И ОТВЕТЫ ПОСЛЕ ВИДОСА МАКСИМА
Привет, синтеты и максойды! 👋
После видоса imaxai народ оживился с вопросами про RUKALLAMA. Раз все спрашивают одно и то же - делаю мегапост с ответами! 🔥
🤔 ЧТО ЗА ЗВЕРЬ ТАКОЙ?
RUKALLAMA - это русская языковая модель, которую разрабатывали и тренировали за срок в 7 месяцев на одной A100 (появилась позже, где-то 3 месяц её владельцем являюсь). Сбербанки и яндексы сильно заняты удешевлением процесса, я сильно занят хоть каким-то подорожанием сетапа , лол...но это лирика. Что там по модели?
📊 ТЕКУЩЕЕ СОСТОЯНИЕ: 187M ПАРАМЕТРОВ, 22 ЭПОХИ
Решается дообучением на конкретных задачах + решение и так далее (это важный следующий этап)
🔥 Эпичные примеры:
🎯 ПОЧЕМУ ОДНА КАРТОЧКА ЧЕТО МОЖЕТ ПРОТИВ КЛАСТЕРОВ КОРПОРАЦИЙ?
Дело в данных, в данных! 🧠
Адаптация моделей западного устроя в плане дообучения на русском языке - имеют свой эффект положительный. Модели действительно лучше общаются на русском, но чем больше я читаю ответов от Rukallama, тем больше я понимаю, что мы забыли как на самом деле раньше общались ❤️ Задача - внести наш менталитет в модель.
⚠️ ТЕКУЩИЕ ПРОБЛЕМЫ (ИЗ ДЕБАГ ЛОГА)
🔬 ТЕХНИЧЕСКИЕ ФИШКИ
Привет, синтеты и максойды! 👋
После видоса imaxai народ оживился с вопросами про RUKALLAMA. Раз все спрашивают одно и то же - делаю мегапост с ответами! 🔥
🤔 ЧТО ЗА ЗВЕРЬ ТАКОЙ?
RUKALLAMA - это русская языковая модель, которую разрабатывали и тренировали за срок в 7 месяцев на одной A100 (появилась позже, где-то 3 месяц её владельцем являюсь). Сбербанки и яндексы сильно заняты удешевлением процесса, я сильно занят хоть каким-то подорожанием сетапа , лол...но это лирика. Что там по модели?
Архитектура SplineGPT:
EfficientKANLinear - параметрические B-сплайны вместо обычных весов (теорема Колмогорова-Арнольда в деле!)
MoELayer - 4 эксперта, каждый 3-й слой
SplineAttention - KAN применяется к Q/K проекциям
Кастомный токенизатор с обработкой русского языка (СВОЙ, НАШ) 😃
📊 ТЕКУЩЕЕ СОСТОЯНИЕ: 187M ПАРАМЕТРОВ, 22 ЭПОХИ
✅ Что работает:
Честно говорит "НЕ ЗНАЮ" вместо галлюцинаций
Понимает советскую терминологию и философию
Генерирует тематически связанный текст
Демонстрирует эпистемологическую скромность
❌ Что НЕ работает:
Простая арифметика (40-30=?)
Современные концепции (удаленка, интернет)
Самоидентификация как AI
Решается дообучением на конкретных задачах + решение и так далее (это важный следующий этап)
🔥 Эпичные примеры:
Вопрос: "Как работать удаленно?"
RUKALLAMA: "автобус... поезд... пароход... плот..."
Модель перебирает ВСЕ известные способы связи из советского датасета! Концепции удаленки просто НЕТ! 😂
🗓 КОГДА МОЖНО ПОТРОГАТЬ?
Сейчас: Никак, модель в активной разработке 🔧
Очень скоро: Сделаю инференс на виртуальной тачке для постоянного тестирования
1-2 месяца: Публичная бета-версия для обкатки (до этого не раз выложу тесты для всех)
2-4 месяца: Полноценный релиз в открытый доступ
🎯 ПОЧЕМУ ОДНА КАРТОЧКА ЧЕТО МОЖЕТ ПРОТИВ КЛАСТЕРОВ КОРПОРАЦИЙ?
Дело в данных, в данных! 🧠
20GB сверхформализованных советских учебников
OCR → DeepSeek-V3 → Аннотация → 4 типа инструкций
Качественная формализация >> количество параметров
Специализация на русском языке и советском наследии
Адаптация моделей западного устроя в плане дообучения на русском языке - имеют свой эффект положительный. Модели действительно лучше общаются на русском, но чем больше я читаю ответов от Rukallama, тем больше я понимаю, что мы забыли как на самом деле раньше общались ❤️ Задача - внести наш менталитет в модель.
⚠️ ТЕКУЩИЕ ПРОБЛЕМЫ (ИЗ ДЕБАГ ЛОГА)
КРИТИЧНО: Токенизатор fail на round-trip тестах (62% вместо 95%+)
Глобальная инициализация весов перезаписывает кастомную логику KAN
Морфологическая консистентность 26-29% (плохо для русского)
MoE load balancing loss = 0 (эксперты не балансируются)
💰 РЕСУРСЫ И ПОДДЕРЖКА
Нужно: Вторая A100, третья и четвертая и пятая...не важно (~1.5-2 млн рублей)
Зачем: Масштабирование архитектуры и ускорение обучения, а также улучшение схождения (это как прозрение)
Планы: Открытый доступ после стабилизации
🤖 ФИЛОСОФИЯ ПРОЕКТА
Постоянно угождать и делать пользователю приятно даже во вред здравому смыслу и стремлению модели закрыть вопрос пользователя даже ценой галлюцинации приводят к плачевным результатам, которые даже не заметны на первый взгляд. Это будет иметь долгосрочные отпечатки на сознании граждан. Модель, которая сохраняет нашу идентичность будет важна в дальнейших инференсах в разных учреждениях, моя задача привнести формализации и честности в "размышления" модели.
🔬 ТЕХНИЧЕСКИЕ ФИШКИ
class EfficientKANLinear(nn.Module):
def forward(self, x):
base_output = self.base_linear(x) # 90% классики
kan_output = self.kan_path(x) # 10% магии Колмогорова-Арнольда
return base_output + gate * kan_output
MoE каждый 3-й слой:
4 эксперта специализируются на разных аспектах
Top-2 routing для эффективности
Load balancing для равномерного использования
🎪 ВЫВОД
RUKALLAMA - это proof-of-concept того, как правильная формализация данных побеждает грубую силу параметров. 187M честных параметров лучше триллионов лживых! Следующий этап: Instruction tuning на базе собранного feedback'а от пользователей.
🔥69👍23❤9🫡7😱2
Андрей Карпатый придумал вайб-кодинг. А я придумал термин - синтетический айтишник. Синтет это подпищег, а подпищеги синтеты.
👍28❤7😁1
https://t.iss.one/boost/technojnec
Йоу. Бустанем на обои красивые ?) я там все добавил. Доброе утро, синтеты.
Йоу. Бустанем на обои красивые ?) я там все добавил. Доброе утро, синтеты.
Telegram
Техножнец
Проголосуйте за канал, чтобы он получил больше возможностей.
🫡9
Начал день с 200 отжиманий и 30 подтягиваний, 20 приседов, 20 пресса. И вам того же желаю!
🔥38👍8
🌋 HeyGen Avatar IV против Mirage Studio: Новые ИИ Аватары - Стоит ли Хайпа? 🌋
Привет, синтеты! С вами Техножнец, и сегодня мы препарируем очередной хайповый вброс про "революционные" ИИ-аватары. В сети активно форсят два свежих инструмента, вокруг которых инфлюенсеры уже успели развести шумиху в стиле "всё, приехали, это конец!" или "просто безумие!". Речь идет о HeyGen Avatar IV и Mirage Studio. Мы провели собственное расследование и готовы доложить, так ли они круты, или это очередной мыльный пузырь.
1. HeyGen Avatar IV (с Motion Control)
Ссылка: https://www.heygen.com/
Этот инструмент обещает не просто оживить картинку под аудио, но и добавить кастомные движения и жесты по текстовому промпту. Звучит амбициозно.
Тесты показали:
Вердикт по HeyGen:
Пока "не фонтан". Липсинк неплох, но анимация движений и эмоций очень роботизированная, а кастомные жесты работают через раз и далеко не всегда так, как задумано. И очень уж долгая генерация.
2. Mirage Studio (от создателей Captions app)
Ссылка: https://mirage.app/
Этот инструмент, по заявлениям, должен генерировать особенно экспрессивные выступления.
Ключевая особенность (и главный косяк, о котором почему-то молчат инфлюенсеры): Mirage разбивает длинное аудио на куски максимум по 4 секунды и склеивает их жесткими склейками. Это, мягко говоря, проблема.
Тесты показали:
HeyGen предлагает интересную идею с кастомными жестами, но реализация хромает: анимации скованные, жесты не всегда точные, а сильные эмоции или пение – это вообще мимо.
Mirage Studio действительно лучше передает эмоции (особенно смех) и делает более живые движения для простой речи, но имеет фатальный недостаток – разбивка видео на 4-секундные сегменты с жесткими переходами. Это делает его практически бесполезным для чего-то длиннее короткой фразы, особенно для динамичного контента вроде рэпа или пения. К тому же, процесс генерации очень медленный.
На данный момент, для создания реалистичных аватаров, тот же OmniHuman (о котором мы говорили ранее) выглядит куда убедительнее. Так что, синтеты, хайп – это хорошо, но всегда проверяйте сами. Технологии развиваются, но до полной замены живых актеров ИИ-аватарами еще пилить и пилить. Ждем обновлений, а пока – это скорее игрушки с ограниченным применением. До связи!
Привет, синтеты! С вами Техножнец, и сегодня мы препарируем очередной хайповый вброс про "революционные" ИИ-аватары. В сети активно форсят два свежих инструмента, вокруг которых инфлюенсеры уже успели развести шумиху в стиле "всё, приехали, это конец!" или "просто безумие!". Речь идет о HeyGen Avatar IV и Mirage Studio. Мы провели собственное расследование и готовы доложить, так ли они круты, или это очередной мыльный пузырь.
1. HeyGen Avatar IV (с Motion Control)
Ссылка: https://www.heygen.com/
Этот инструмент обещает не просто оживить картинку под аудио, но и добавить кастомные движения и жесты по текстовому промпту. Звучит амбициозно.
Тесты показали:
Новостной ведущий: При попытке заставить его жестикулировать по промпту ("серьезный взгляд, руки вверх-вниз, в конце палец вверх") и говорить, пришлось ждать 10 минут ради 6 секунд результата. Жесты частично сработали, но ведущий внезапно обзавелся бумагами, возникшими из ниоткуда. Липсинк – ну, такое.
Девушка-геймер (говорящая про свое пение): Промпт на касание волос и знак "peace" был проигнорирован. Анимация деревянная, губы шевелятся, но экспрессии – ноль.
Рэпер с мопсом: Промпт на "страстный рэп, грув всем телом, рубящие движения рукой". Липсинк неплох, но телодвижения как у манекена, никакого грува.
Поющая девушка (другой пример): Промпт "поет страстно, рука на груди" привел к полному фиаско – не похоже на страстное пение, липсинк посредственный.
Тест на японском: Липсинк хороший, но жесты по промпту ("двигает руками, хлопает, касается микрофона") получились неестественными, хотя часть команд выполнена
Плачущий мужчина: Инструмент не смог осилить сильные эмоции, результат очень скованный.
Вердикт по HeyGen:
Пока "не фонтан". Липсинк неплох, но анимация движений и эмоций очень роботизированная, а кастомные жесты работают через раз и далеко не всегда так, как задумано. И очень уж долгая генерация.
2. Mirage Studio (от создателей Captions app)
Ссылка: https://mirage.app/
Этот инструмент, по заявлениям, должен генерировать особенно экспрессивные выступления.
Ключевая особенность (и главный косяк, о котором почему-то молчат инфлюенсеры): Mirage разбивает длинное аудио на куски максимум по 4 секунды и склеивает их жесткими склейками. Это, мягко говоря, проблема.
Тесты показали:
Смех: Результат более естественный, чем у HeyGen.
Разговорная речь: С простой речью справляется хорошо.
Рэп: Движения аватара действительно живее и естественнее, чем у HeyGen, но эти 4-секундные жесткие склейки просто убивают весь эффект.
Пение: Опять провал. Аватар даже не пытался петь, просто смотрел в камеру.
Плачущий мужчина (сгенерирован по тексту): Актер получился грустным, но не в той локации. Эмоция чуть лучше, но выглядит жутковато.
Немецкий и японский языки: Липсинк для разговора хороший.
Общий вывод:
Несмотря на восторженные крики инфлюенсеров, ни HeyGen Avatar IV, ни Mirage Studio пока не тянут на звание "гейм-ченджеров".
HeyGen предлагает интересную идею с кастомными жестами, но реализация хромает: анимации скованные, жесты не всегда точные, а сильные эмоции или пение – это вообще мимо.
Mirage Studio действительно лучше передает эмоции (особенно смех) и делает более живые движения для простой речи, но имеет фатальный недостаток – разбивка видео на 4-секундные сегменты с жесткими переходами. Это делает его практически бесполезным для чего-то длиннее короткой фразы, особенно для динамичного контента вроде рэпа или пения. К тому же, процесс генерации очень медленный.
На данный момент, для создания реалистичных аватаров, тот же OmniHuman (о котором мы говорили ранее) выглядит куда убедительнее. Так что, синтеты, хайп – это хорошо, но всегда проверяйте сами. Технологии развиваются, но до полной замены живых актеров ИИ-аватарами еще пилить и пилить. Ждем обновлений, а пока – это скорее игрушки с ограниченным применением. До связи!
❤11👍7🫡1
Техножнец
🌋 HeyGen Avatar IV против Mirage Studio: Новые ИИ Аватары - Стоит ли Хайпа? 🌋 Привет, синтеты! С вами Техножнец, и сегодня мы препарируем очередной хайповый вброс про "революционные" ИИ-аватары. В сети активно форсят два свежих инструмента, вокруг которых…
Media is too big
VIEW IN TELEGRAM
Вот, собсна, как выглядят тесты.
👍6
Media is too big
VIEW IN TELEGRAM
Barometr - Blestyashka
А вот как я пользуюсь этим. Если нравится песня, ставь лайк!
А вот как я пользуюсь этим. Если нравится песня, ставь лайк!
👍38🥰5❤3🤯1
Был в РНБ (Российская Национальная Библиотека) вызывал меня оттуда Дмитрий из IT отдела. Обсуждали вопрос помощи ии в каталогизации библиотеки, возможные технологии + подводные камни.
Очень выглядит как взаимовыгодное сотрудничество.
Пообщались с коллективом it отдела библиотеки и побывал на двух часовой экскурсии. Это люто!!!
Я доволен, новости позже.
А мы завтра снова на связи с РНБ
Очень выглядит как взаимовыгодное сотрудничество.
Пообщались с коллективом it отдела библиотеки и побывал на двух часовой экскурсии. Это люто!!!
Я доволен, новости позже.
А мы завтра снова на связи с РНБ
🔥60👍18⚡7❤4
Синтеты, нейрогон на связи. там билдится что-то в Unity. Это покажу.
Кто не понимает о чем речь, то вот последний выпуск нашего шоу "Нейрогон"
https://rutube.ru/video/09ca95502d07192e5db7b7b5fd056c43/
Мой микс начинается со свторого часа. Продакшен весь работает в реальном времени с одного компа через UNITY: 3 камеры, 2 баклана чето гонят - ае.
Кто не понимает о чем речь, то вот последний выпуск нашего шоу "Нейрогон"
https://rutube.ru/video/09ca95502d07192e5db7b7b5fd056c43/
Мой микс начинается со свторого часа. Продакшен весь работает в реальном времени с одного компа через UNITY: 3 камеры, 2 баклана чето гонят - ае.
❤16👍12❤🔥5🔥4👻1
Техножнец
Синтеты, нейрогон на связи. там билдится что-то в Unity. Это покажу. Кто не понимает о чем речь, то вот последний выпуск нашего шоу "Нейрогон" https://rutube.ru/video/09ca95502d07192e5db7b7b5fd056c43/ Мой микс начинается со свторого часа. Продакшен весь…
Общий вид. На изображении "Резонатор 3000" - корабль, который очень много апгредился, ремонтировался, переделывался. У него было много итераций. Посмотрите выпуск по ссылке выше, а увидимся мы уже завтра в 20:00 на канале нейропанк ❤️
🥰13👍8🔥7⚡2❤1👻1
Привет, синтеты. Сегодня дел много по лейблу и по вечеринке. А вот со следующей недели пойдёт шквал наработок и общения.
Расскажите, пока что, как проходят ваши выходные ?
Расскажите, пока что, как проходят ваши выходные ?
🤖 ТЕХНИЧЕСКИЙ ДАЙДЖЕСТ: AI БЕЗУМИЕ ЭТОЙ НЕДЕЛИ!
Привет, синтеты! 👋
Если вы думали, что AI уже удивить нечем - вы крупно ошибались! Эта неделя принесла столько прорывов, что голова кругом идёт. От 3D-болталок до предсказателей аварий - разбираем самые жирные апдейты! 🚀
## 🎯 ShapeLLM Omni: Когда ChatGPT решил стать 3D-дизайнером
ShapeLLM - это как если бы ChatGPT внезапно научился лепить из пластилина, только в цифре. Мультимодальная модель на 7 миллиардов параметров, которая:
🔥 Что умеет:
- Генерит 3D модели из текста или картинки
- Анализирует готовые 3D объекты (и даже определяет пистолет как пистолет!)
- Редактирует модели через обычный чат
- Отвечает на вопросы про 3D объекты
⚠️ Реальность: Качество пока так себе, но концепция огонь! Всё уже на HuggingFace, можно пощупать локально.
## 🎬 FlowMo: Антидепрессант для видео-генерации
FlowMo - это как фотошоп, только для сглаживания корявых AI видео. Плагин, который превращает дёргающиеся артефакты в плавные движения.
💡 Фишка: Работает поверх любых видео-моделей! Протестировали на One 2.1 и CogVideoX - результат впечатляет.
🧠 Как работает: Анализирует variance между кадрами и магически делает всё гладко.
## 🖼 NiT: Революция разрешений
Native Resolution Image Synthesis - наконец-то кто-то решил проблему с кастомными размерами изображений!
🎨 Прорыв: Генерирует качественные картинки в ЛЮБОМ соотношении сторон без дообучения на специфичных размерах.
Примеры безумия:
- 1280x256 (супер-широкие)
- 960x320 (кинематографичные)
- Вертикальные небоскрёбы
⚖️ Компромисс: Качество не топ, но гибкость - космос!
## 💥 Ctrl-Crash: AI-оракул автомобильных катастроф
Ctrl-Crash - самый специфичный AI этой недели! Генерирует реалистичные видео автоаварий из одного кадра.
🚗 Типы краша:
- ego-only (сам врезался)
- ego+vehicle (столкновение)
- vehicle+vehicle (разборки без тебя)
🎯 Применение: Тренировка беспилотников и анализ безопасности. Sora в сравнении выглядит как детские каракули!
## 🎮 DeepVerse: Когда AI становится геймером
DeepVerse - генератор геймплея, который понимает физику, освещение и не даёт персонажам проваливаться сквозь стены!
🕹 Возможности:
- Управление через геймпад
- Любые игры (не привязан к конкретной, как Google's Doom)
- Реалистичная физика
❌ Облом: Код пока не опубликован, только демки.
## 🆓 Microsoft раздаёт Sora бесплатно!
Bing Video Creator - качайте мобильное приложение Bing и генерьте видео на Sora без ограничений!
📱 Условия:
- Только мобилка
- 5 секунд, вертикальный формат
- 10 быстрых генераций + безлимит медленных
🤷♂️ Но: Sora уже не торт, есть модели и покруче.
## 🎭 Skyreels Audio: Локальная альтернатива VO3
Skyreels Audio - open-source инструмент для генерации говорящих видео.
🗣 Фишки:
- Лип-синк с любым аудио
- Анимация всего тела, не только губ
- Работает даже с нереалистичными персонажами
📊 Сравнение: Лучше Omni и Fantasy Talking, но репо пока без кода.
## 🤖 Hunyuan Custom: Китайцы не дремлют
Hunyuan Custom получил аудио-фичи! Теперь можно:
🎵 Новые возможности:
- Лип-синк с кастомным аудио
- Редактирование объектов в видео
- Замена персонажей на лету
⚡️ Требования: 80GB VRAM (пока что для избранных)
## 👤 Pixel3DMM: Сканер лиц будущего
Pixel3DMM создаёт супер-точные 3D модели лиц из одной фотки.
🎯 Точность: На 15% лучше конкурентов, особенно с трудными выражениями и углами.
🔬 Технология: Минимальные ошибки даже при экстремальных мимических деформациях.
## 🧠 Gemini 2.5 Pro: Google давит всех
Новая версия Gemini 2.5 Pro (0605) захватила все топы:
Привет, синтеты! 👋
Если вы думали, что AI уже удивить нечем - вы крупно ошибались! Эта неделя принесла столько прорывов, что голова кругом идёт. От 3D-болталок до предсказателей аварий - разбираем самые жирные апдейты! 🚀
## 🎯 ShapeLLM Omni: Когда ChatGPT решил стать 3D-дизайнером
ShapeLLM - это как если бы ChatGPT внезапно научился лепить из пластилина, только в цифре. Мультимодальная модель на 7 миллиардов параметров, которая:
🔥 Что умеет:
- Генерит 3D модели из текста или картинки
- Анализирует готовые 3D объекты (и даже определяет пистолет как пистолет!)
- Редактирует модели через обычный чат
- Отвечает на вопросы про 3D объекты
⚠️ Реальность: Качество пока так себе, но концепция огонь! Всё уже на HuggingFace, можно пощупать локально.
## 🎬 FlowMo: Антидепрессант для видео-генерации
FlowMo - это как фотошоп, только для сглаживания корявых AI видео. Плагин, который превращает дёргающиеся артефакты в плавные движения.
💡 Фишка: Работает поверх любых видео-моделей! Протестировали на One 2.1 и CogVideoX - результат впечатляет.
🧠 Как работает: Анализирует variance между кадрами и магически делает всё гладко.
## 🖼 NiT: Революция разрешений
Native Resolution Image Synthesis - наконец-то кто-то решил проблему с кастомными размерами изображений!
🎨 Прорыв: Генерирует качественные картинки в ЛЮБОМ соотношении сторон без дообучения на специфичных размерах.
Примеры безумия:
- 1280x256 (супер-широкие)
- 960x320 (кинематографичные)
- Вертикальные небоскрёбы
⚖️ Компромисс: Качество не топ, но гибкость - космос!
## 💥 Ctrl-Crash: AI-оракул автомобильных катастроф
Ctrl-Crash - самый специфичный AI этой недели! Генерирует реалистичные видео автоаварий из одного кадра.
🚗 Типы краша:
- ego-only (сам врезался)
- ego+vehicle (столкновение)
- vehicle+vehicle (разборки без тебя)
🎯 Применение: Тренировка беспилотников и анализ безопасности. Sora в сравнении выглядит как детские каракули!
## 🎮 DeepVerse: Когда AI становится геймером
DeepVerse - генератор геймплея, который понимает физику, освещение и не даёт персонажам проваливаться сквозь стены!
🕹 Возможности:
- Управление через геймпад
- Любые игры (не привязан к конкретной, как Google's Doom)
- Реалистичная физика
❌ Облом: Код пока не опубликован, только демки.
## 🆓 Microsoft раздаёт Sora бесплатно!
Bing Video Creator - качайте мобильное приложение Bing и генерьте видео на Sora без ограничений!
📱 Условия:
- Только мобилка
- 5 секунд, вертикальный формат
- 10 быстрых генераций + безлимит медленных
🤷♂️ Но: Sora уже не торт, есть модели и покруче.
## 🎭 Skyreels Audio: Локальная альтернатива VO3
Skyreels Audio - open-source инструмент для генерации говорящих видео.
🗣 Фишки:
- Лип-синк с любым аудио
- Анимация всего тела, не только губ
- Работает даже с нереалистичными персонажами
📊 Сравнение: Лучше Omni и Fantasy Talking, но репо пока без кода.
## 🤖 Hunyuan Custom: Китайцы не дремлют
Hunyuan Custom получил аудио-фичи! Теперь можно:
🎵 Новые возможности:
- Лип-синк с кастомным аудио
- Редактирование объектов в видео
- Замена персонажей на лету
⚡️ Требования: 80GB VRAM (пока что для избранных)
## 👤 Pixel3DMM: Сканер лиц будущего
Pixel3DMM создаёт супер-точные 3D модели лиц из одной фотки.
🎯 Точность: На 15% лучше конкурентов, особенно с трудными выражениями и углами.
🔬 Технология: Минимальные ошибки даже при экстремальных мимических деформациях.
## 🧠 Gemini 2.5 Pro: Google давит всех
Новая версия Gemini 2.5 Pro (0605) захватила все топы:
👍14❤3🔥1🥰1😨1
Продолжение дайджеста:
Проновую версию Gemini 2.5 Pro
🏆 Доминация:
- #1 в LM Arena (ELO 1470)
- #1 по математике, коду, креативу
- Контекст 1M токенов vs 200K у конкурентов
📊 Фишка: 90%+ точность даже на промптах в 192,000 слов!
## 🎙 Голосовые войны: 11Labs vs OpenAudio
ElevenLabs V3: Теги эмоций прямо в тексте
OpenAudio S1: Open-source альтернатива с похожими фичами
🎭 Эмоции: angry, sad, excited, sarcastic + спецэффекты (смех, шёпот)
⚖️ Вердикт: 11Labs качественнее, OpenAudio бесплатнее.
## 🤔 Итоговый расклад:
Эта неделя показала: AI переходит от "вау, работает!" к "блин, это уже серьёзно". Особенно впечатляет специализация - от краш-тестов до лип-синка.
Самое годное для экспериментов:
1. Бесплатная Sora в Bing 📱
2. Gemini 2.5 Pro для сложных задач 🧠
3. OpenAudio для голосовых экспериментов 🎙
Следить обязательно:
- DeepVerse (когда код выложат)
- Hunyuan Custom (когда VRAM подешевеет)
Что скажете, синтеты? Какой инструмент первым пойдёте щупать? 🔥
---
*P.S. Кто успел протестить что-то из списка - делитесь впечатлениями в комментах! 😎*
#AI #TechReview #OpenSource #ComputerVision #GenerativeAI
Проновую версию Gemini 2.5 Pro
🏆 Доминация:
- #1 в LM Arena (ELO 1470)
- #1 по математике, коду, креативу
- Контекст 1M токенов vs 200K у конкурентов
📊 Фишка: 90%+ точность даже на промптах в 192,000 слов!
## 🎙 Голосовые войны: 11Labs vs OpenAudio
ElevenLabs V3: Теги эмоций прямо в тексте
OpenAudio S1: Open-source альтернатива с похожими фичами
🎭 Эмоции: angry, sad, excited, sarcastic + спецэффекты (смех, шёпот)
⚖️ Вердикт: 11Labs качественнее, OpenAudio бесплатнее.
## 🤔 Итоговый расклад:
Эта неделя показала: AI переходит от "вау, работает!" к "блин, это уже серьёзно". Особенно впечатляет специализация - от краш-тестов до лип-синка.
Самое годное для экспериментов:
1. Бесплатная Sora в Bing 📱
2. Gemini 2.5 Pro для сложных задач 🧠
3. OpenAudio для голосовых экспериментов 🎙
Следить обязательно:
- DeepVerse (когда код выложат)
- Hunyuan Custom (когда VRAM подешевеет)
Что скажете, синтеты? Какой инструмент первым пойдёте щупать? 🔥
---
*P.S. Кто успел протестить что-то из списка - делитесь впечатлениями в комментах! 😎*
#AI #TechReview #OpenSource #ComputerVision #GenerativeAI
👍15