Техножнец
5.64K subscribers
1.62K photos
272 videos
12 files
892 links
Канал моих увлечений и поделок. Всё ,что я делаю и выкладываю здесь - делается с любовью.

Поддержать канал: https://tbank.ru/cf/8Xnajl01ehm

Поддержать канал: https://yoomoney.ru/fundraise/1C86E2DGIU9.250819
Download Telegram
Ох, новости)) щас расскажу...там Максим Imaxai бунд устроил...
👍19
Media is too big
VIEW IN TELEGRAM
🚀 RUKALLAMA: ВСЕ ВОПРОСЫ И ОТВЕТЫ ПОСЛЕ ВИДОСА МАКСИМА

Привет, синтеты и максойды! 👋

После видоса imaxai народ оживился с вопросами про RUKALLAMA. Раз все спрашивают одно и то же - делаю мегапост с ответами! 🔥

🤔 ЧТО ЗА ЗВЕРЬ ТАКОЙ?

RUKALLAMA - это русская языковая модель, которую разрабатывали и тренировали за срок в 7 месяцев на одной A100 (появилась позже, где-то 3 месяц её владельцем являюсь). Сбербанки и яндексы сильно заняты удешевлением процесса, я сильно занят хоть каким-то подорожанием сетапа , лол...но это лирика. Что там по модели?

Архитектура SplineGPT:

EfficientKANLinear - параметрические B-сплайны вместо обычных весов (теорема Колмогорова-Арнольда в деле!)
MoELayer - 4 эксперта, каждый 3-й слой
SplineAttention - KAN применяется к Q/K проекциям
Кастомный токенизатор с обработкой русского языка (СВОЙ, НАШ) 😃


📊 ТЕКУЩЕЕ СОСТОЯНИЕ: 187M ПАРАМЕТРОВ, 22 ЭПОХИ

Что работает:

Честно говорит "НЕ ЗНАЮ" вместо галлюцинаций
Понимает советскую терминологию и философию
Генерирует тематически связанный текст
Демонстрирует эпистемологическую скромность


Что НЕ работает:

Простая арифметика (40-30=?)
Современные концепции (удаленка, интернет)
Самоидентификация как AI

Решается дообучением на конкретных задачах + решение и так далее (это важный следующий этап)


🔥 Эпичные примеры:

Вопрос: "Как работать удаленно?"
RUKALLAMA: "автобус... поезд... пароход... плот..."
Модель перебирает ВСЕ известные способы связи из советского датасета! Концепции удаленки просто НЕТ! 😂


🗓 КОГДА МОЖНО ПОТРОГАТЬ?

Сейчас: Никак, модель в активной разработке 🔧
Очень скоро: Сделаю инференс на виртуальной тачке для постоянного тестирования
1-2 месяца: Публичная бета-версия для обкатки (до этого не раз выложу тесты для всех)
2-4 месяца: Полноценный релиз в открытый доступ


🎯 ПОЧЕМУ ОДНА КАРТОЧКА ЧЕТО МОЖЕТ ПРОТИВ КЛАСТЕРОВ КОРПОРАЦИЙ?

Дело в данных, в данных! 🧠


20GB сверхформализованных советских учебников
OCR → DeepSeek-V3 → Аннотация → 4 типа инструкций
Качественная формализация >> количество параметров
Специализация на русском языке и советском наследии


Адаптация моделей западного устроя в плане дообучения на русском языке - имеют свой эффект положительный. Модели действительно лучше общаются на русском, но чем больше я читаю ответов от Rukallama, тем больше я понимаю, что мы забыли как на самом деле раньше общались ❤️ Задача - внести наш менталитет в модель.

⚠️ ТЕКУЩИЕ ПРОБЛЕМЫ (ИЗ ДЕБАГ ЛОГА)

КРИТИЧНО: Токенизатор fail на round-trip тестах (62% вместо 95%+)
Глобальная инициализация весов перезаписывает кастомную логику KAN
Морфологическая консистентность 26-29% (плохо для русского)
MoE load balancing loss = 0 (эксперты не балансируются)


💰 РЕСУРСЫ И ПОДДЕРЖКА

Нужно: Вторая A100, третья и четвертая и пятая...не важно (~1.5-2 млн рублей)
Зачем: Масштабирование архитектуры и ускорение обучения, а также улучшение схождения (это как прозрение)
Планы: Открытый доступ после стабилизации


🤖 ФИЛОСОФИЯ ПРОЕКТА

Постоянно угождать и делать пользователю приятно даже во вред здравому смыслу и стремлению модели закрыть вопрос пользователя даже ценой галлюцинации приводят к плачевным результатам, которые даже не заметны на первый взгляд. Это будет иметь долгосрочные отпечатки на сознании граждан. Модель, которая сохраняет нашу идентичность будет важна в дальнейших инференсах в разных учреждениях, моя задача привнести формализации и честности в "размышления" модели.


🔬 ТЕХНИЧЕСКИЕ ФИШКИ

class EfficientKANLinear(nn.Module):
def forward(self, x):
base_output = self.base_linear(x) # 90% классики
kan_output = self.kan_path(x) # 10% магии Колмогорова-Арнольда
return base_output + gate * kan_output

MoE каждый 3-й слой:

4 эксперта специализируются на разных аспектах
Top-2 routing для эффективности
Load balancing для равномерного использования


🎪 ВЫВОД

RUKALLAMA - это proof-of-concept того, как правильная формализация данных побеждает грубую силу параметров. 187M честных параметров лучше триллионов лживых! Следующий этап: Instruction tuning на базе собранного feedback'а от пользователей.
🔥69👍239🫡7😱2
Спасибо огромное Максиму IMAXAI за такую поддержку ❤️
👍36👌198👾8🥴1😴1
Точнее на момент поста 951 (там сразу будет отписка после такого поста - пройденный этап. а потом снова наладится)

Всем новым, привет. Вы теперь синтеты.
👌26🔥12🎉104🤝1
...
131🔥25😁8👏52
Андрей Карпатый придумал вайб-кодинг. А я придумал термин - синтетический айтишник. Синтет это подпищег, а подпищеги синтеты.
👍287😁1
https://t.iss.one/boost/technojnec

Йоу. Бустанем на обои красивые ?) я там все добавил. Доброе утро, синтеты.
🫡9
Начал день с 200 отжиманий и 30 подтягиваний, 20 приседов, 20 пресса. И вам того же желаю!
🔥38👍8
Лицо нейросетей видели?
😁351
🌋 HeyGen Avatar IV против Mirage Studio: Новые ИИ Аватары - Стоит ли Хайпа? 🌋

Привет, синтеты! С вами Техножнец, и сегодня мы препарируем очередной хайповый вброс про "революционные" ИИ-аватары. В сети активно форсят два свежих инструмента, вокруг которых инфлюенсеры уже успели развести шумиху в стиле "всё, приехали, это конец!" или "просто безумие!". Речь идет о HeyGen Avatar IV и Mirage Studio. Мы провели собственное расследование и готовы доложить, так ли они круты, или это очередной мыльный пузырь.

1. HeyGen Avatar IV (с Motion Control)
Ссылка: https://www.heygen.com/

Этот инструмент обещает не просто оживить картинку под аудио, но и добавить кастомные движения и жесты по текстовому промпту. Звучит амбициозно.

Тесты показали:

Новостной ведущий: При попытке заставить его жестикулировать по промпту ("серьезный взгляд, руки вверх-вниз, в конце палец вверх") и говорить, пришлось ждать 10 минут ради 6 секунд результата. Жесты частично сработали, но ведущий внезапно обзавелся бумагами, возникшими из ниоткуда. Липсинк – ну, такое.


Девушка-геймер (говорящая про свое пение): Промпт на касание волос и знак "peace" был проигнорирован. Анимация деревянная, губы шевелятся, но экспрессии – ноль.


Рэпер с мопсом: Промпт на "страстный рэп, грув всем телом, рубящие движения рукой". Липсинк неплох, но телодвижения как у манекена, никакого грува.


Поющая девушка (другой пример): Промпт "поет страстно, рука на груди" привел к полному фиаско – не похоже на страстное пение, липсинк посредственный.


Тест на японском: Липсинк хороший, но жесты по промпту ("двигает руками, хлопает, касается микрофона") получились неестественными, хотя часть команд выполнена



Плачущий мужчина: Инструмент не смог осилить сильные эмоции, результат очень скованный.


Вердикт по HeyGen:

Пока "не фонтан". Липсинк неплох, но анимация движений и эмоций очень роботизированная, а кастомные жесты работают через раз и далеко не всегда так, как задумано. И очень уж долгая генерация.

2. Mirage Studio (от создателей Captions app)
Ссылка: https://mirage.app/

Этот инструмент, по заявлениям, должен генерировать особенно экспрессивные выступления.

Ключевая особенность (и главный косяк, о котором почему-то молчат инфлюенсеры): Mirage разбивает длинное аудио на куски максимум по 4 секунды и склеивает их жесткими склейками. Это, мягко говоря, проблема.

Тесты показали:

Смех: Результат более естественный, чем у HeyGen.


Разговорная речь: С простой речью справляется хорошо.


Рэп: Движения аватара действительно живее и естественнее, чем у HeyGen, но эти 4-секундные жесткие склейки просто убивают весь эффект.


Пение: Опять провал. Аватар даже не пытался петь, просто смотрел в камеру.


Плачущий мужчина (сгенерирован по тексту): Актер получился грустным, но не в той локации. Эмоция чуть лучше, но выглядит жутковато.


Немецкий и японский языки: Липсинк для разговора хороший.


Общий вывод:

Несмотря на восторженные крики инфлюенсеров, ни HeyGen Avatar IV, ни Mirage Studio пока не тянут на звание "гейм-ченджеров".


HeyGen предлагает интересную идею с кастомными жестами, но реализация хромает: анимации скованные, жесты не всегда точные, а сильные эмоции или пение – это вообще мимо.

Mirage Studio действительно лучше передает эмоции (особенно смех) и делает более живые движения для простой речи, но имеет фатальный недостаток – разбивка видео на 4-секундные сегменты с жесткими переходами. Это делает его практически бесполезным для чего-то длиннее короткой фразы, особенно для динамичного контента вроде рэпа или пения. К тому же, процесс генерации очень медленный.

На данный момент, для создания реалистичных аватаров, тот же OmniHuman (о котором мы говорили ранее) выглядит куда убедительнее. Так что, синтеты, хайп – это хорошо, но всегда проверяйте сами. Технологии развиваются, но до полной замены живых актеров ИИ-аватарами еще пилить и пилить. Ждем обновлений, а пока – это скорее игрушки с ограниченным применением. До связи!
11👍7🫡1
Media is too big
VIEW IN TELEGRAM
Barometr - Blestyashka

А вот как я пользуюсь этим. Если нравится песня, ставь лайк!
👍38🥰53🤯1
Был в РНБ (Российская Национальная Библиотека) вызывал меня оттуда Дмитрий из IT отдела. Обсуждали вопрос помощи ии в каталогизации библиотеки, возможные технологии + подводные камни.

Очень выглядит как взаимовыгодное сотрудничество.

Пообщались с коллективом it отдела библиотеки и побывал на двух часовой экскурсии. Это люто!!!

Я доволен, новости позже.
А мы завтра снова на связи с РНБ
🔥60👍1874
Синтеты, нейрогон на связи. там билдится что-то в Unity. Это покажу.

Кто не понимает о чем речь, то вот последний выпуск нашего шоу "Нейрогон"

https://rutube.ru/video/09ca95502d07192e5db7b7b5fd056c43/

Мой микс начинается со свторого часа. Продакшен весь работает в реальном времени с одного компа через UNITY: 3 камеры, 2 баклана чето гонят - ае.
16👍12❤‍🔥5🔥4👻1
Техножнец
Синтеты, нейрогон на связи. там билдится что-то в Unity. Это покажу. Кто не понимает о чем речь, то вот последний выпуск нашего шоу "Нейрогон" https://rutube.ru/video/09ca95502d07192e5db7b7b5fd056c43/ Мой микс начинается со свторого часа. Продакшен весь…
Общий вид. На изображении "Резонатор 3000" - корабль, который очень много апгредился, ремонтировался, переделывался. У него было много итераций. Посмотрите выпуск по ссылке выше, а увидимся мы уже завтра в 20:00 на канале нейропанк ❤️
🥰13👍8🔥721👻1
This media is not supported in your browser
VIEW IN TELEGRAM
❤‍🔥26👏12👍72
Техножнец
Video message
Перенос на четверг. Но там будет дополнительный панч.
10👌5🥰3👍1
Привет, синтеты. Сегодня дел много по лейблу и по вечеринке. А вот со следующей недели пойдёт шквал наработок и общения.

Расскажите, пока что, как проходят ваши выходные ?
🤖 ТЕХНИЧЕСКИЙ ДАЙДЖЕСТ: AI БЕЗУМИЕ ЭТОЙ НЕДЕЛИ!

Привет, синтеты! 👋

Если вы думали, что AI уже удивить нечем - вы крупно ошибались! Эта неделя принесла столько прорывов, что голова кругом идёт. От 3D-болталок до предсказателей аварий - разбираем самые жирные апдейты! 🚀

## 🎯 ShapeLLM Omni: Когда ChatGPT решил стать 3D-дизайнером

ShapeLLM - это как если бы ChatGPT внезапно научился лепить из пластилина, только в цифре. Мультимодальная модель на 7 миллиардов параметров, которая:

🔥 Что умеет:
- Генерит 3D модели из текста или картинки
- Анализирует готовые 3D объекты (и даже определяет пистолет как пистолет!)
- Редактирует модели через обычный чат
- Отвечает на вопросы про 3D объекты

⚠️ Реальность: Качество пока так себе, но концепция огонь! Всё уже на HuggingFace, можно пощупать локально.

## 🎬 FlowMo: Антидепрессант для видео-генерации

FlowMo - это как фотошоп, только для сглаживания корявых AI видео. Плагин, который превращает дёргающиеся артефакты в плавные движения.

💡 Фишка: Работает поверх любых видео-моделей! Протестировали на One 2.1 и CogVideoX - результат впечатляет.

🧠 Как работает: Анализирует variance между кадрами и магически делает всё гладко.

## 🖼 NiT: Революция разрешений

Native Resolution Image Synthesis - наконец-то кто-то решил проблему с кастомными размерами изображений!

🎨 Прорыв: Генерирует качественные картинки в ЛЮБОМ соотношении сторон без дообучения на специфичных размерах.

Примеры безумия:
- 1280x256 (супер-широкие)
- 960x320 (кинематографичные)
- Вертикальные небоскрёбы

⚖️ Компромисс: Качество не топ, но гибкость - космос!

## 💥 Ctrl-Crash: AI-оракул автомобильных катастроф

Ctrl-Crash - самый специфичный AI этой недели! Генерирует реалистичные видео автоаварий из одного кадра.

🚗 Типы краша:
- ego-only (сам врезался)
- ego+vehicle (столкновение)
- vehicle+vehicle (разборки без тебя)

🎯 Применение: Тренировка беспилотников и анализ безопасности. Sora в сравнении выглядит как детские каракули!

## 🎮 DeepVerse: Когда AI становится геймером

DeepVerse - генератор геймплея, который понимает физику, освещение и не даёт персонажам проваливаться сквозь стены!

🕹 Возможности:
- Управление через геймпад
- Любые игры (не привязан к конкретной, как Google's Doom)
- Реалистичная физика

Облом: Код пока не опубликован, только демки.

## 🆓 Microsoft раздаёт Sora бесплатно!

Bing Video Creator - качайте мобильное приложение Bing и генерьте видео на Sora без ограничений!

📱 Условия:
- Только мобилка
- 5 секунд, вертикальный формат
- 10 быстрых генераций + безлимит медленных

🤷‍♂️ Но: Sora уже не торт, есть модели и покруче.

## 🎭 Skyreels Audio: Локальная альтернатива VO3

Skyreels Audio - open-source инструмент для генерации говорящих видео.

🗣 Фишки:
- Лип-синк с любым аудио
- Анимация всего тела, не только губ
- Работает даже с нереалистичными персонажами

📊 Сравнение: Лучше Omni и Fantasy Talking, но репо пока без кода.

## 🤖 Hunyuan Custom: Китайцы не дремлют

Hunyuan Custom получил аудио-фичи! Теперь можно:

🎵 Новые возможности:
- Лип-синк с кастомным аудио
- Редактирование объектов в видео
- Замена персонажей на лету

⚡️ Требования: 80GB VRAM (пока что для избранных)

## 👤 Pixel3DMM: Сканер лиц будущего

Pixel3DMM создаёт супер-точные 3D модели лиц из одной фотки.

🎯 Точность: На 15% лучше конкурентов, особенно с трудными выражениями и углами.

🔬 Технология: Минимальные ошибки даже при экстремальных мимических деформациях.

## 🧠 Gemini 2.5 Pro: Google давит всех

Новая версия Gemini 2.5 Pro (0605) захватила все топы:
👍143🔥1🥰1😨1
Продолжение дайджеста:

Проновую версию Gemini 2.5 Pro


🏆 Доминация:
- #1 в LM Arena (ELO 1470)
- #1 по математике, коду, креативу
- Контекст 1M токенов vs 200K у конкурентов

📊 Фишка: 90%+ точность даже на промптах в 192,000 слов!

## 🎙 Голосовые войны: 11Labs vs OpenAudio

ElevenLabs V3: Теги эмоций прямо в тексте
OpenAudio S1: Open-source альтернатива с похожими фичами

🎭 Эмоции: angry, sad, excited, sarcastic + спецэффекты (смех, шёпот)

⚖️ Вердикт: 11Labs качественнее, OpenAudio бесплатнее.

## 🤔 Итоговый расклад:

Эта неделя показала: AI переходит от "вау, работает!" к "блин, это уже серьёзно". Особенно впечатляет специализация - от краш-тестов до лип-синка.

Самое годное для экспериментов:
1. Бесплатная Sora в Bing 📱
2. Gemini 2.5 Pro для сложных задач 🧠
3. OpenAudio для голосовых экспериментов 🎙

Следить обязательно:
- DeepVerse (когда код выложат)
- Hunyuan Custom (когда VRAM подешевеет)

Что скажете, синтеты? Какой инструмент первым пойдёте щупать? 🔥

---
*P.S. Кто успел протестить что-то из списка - делитесь впечатлениями в комментах! 😎*

#AI #TechReview #OpenSource #ComputerVision #GenerativeAI
👍15