Техножнец
5.63K subscribers
1.62K photos
272 videos
12 files
870 links
Канал моих увлечений и поделок. Всё ,что я делаю и выкладываю здесь - делается с любовью.

Поддержать канал: https://tbank.ru/cf/8Xnajl01ehm

Поддержать канал: https://yoomoney.ru/fundraise/1C86E2DGIU9.250819
Download Telegram
Занимаюсь эксплуатацией геометрической формы аттрактора Лоренца.

Потихонечку, помаленечку догоняю трансформер.

Решаю геометрией обобщение семантическое и не только...конкретно решается вопрос как в некоем многомерном пространстве прокинуть нормально обучаемые рёбра за 1 проход.

По сути нет обратной пропагации, нет градиентов, весь путь прозрачный и на геометрии аттрактора.

Векторизируется адекватно, всё ускоряется...НО!

Найти обобщение как делать геометрически правильно на рёбрах - задачка фикс прямо сейчас.

Интересное очень. Почему взял его?

ХРЕН ЕГО ЗНАЕТ!

Кажется, что я начинаю понимать проблему между мной и другими исследователями. У меня геометрические представления в голове нативно укладываются и почти никогда не было такого, что я создавал мусорные конструкции для обучения.

Всегда есть , где усилить...

Но об этом чуть позже.
🔥25👏32
так так так...
🤔10🤗4😱3🤯1
Поговорим о ред флагах?

Состояние биржы на утро 30 июля.
🤔20👏8🔥5
Техножнец
так так так...
Щас буду постить.

Glassformer + substrate
🔥19👏5👍3
Затянулось, т.к. параллельно жизнь + поспать. А то сутки почти на ногах был. Делаю открытую мини wiki проекта Glassformer + Substrate 16 + ALU ткач.
14🤝51
🔷 GLASS - как устроена языковая модель, которую видно насквозь

В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает.

Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно так, не скажет никто, включая её авторов. GLASS - попытка сделать наоборот. Гипотеза простая и дерзкая:

трансформер - не монолит. Его механизмы можно ОТЛИТЬ в прозрачные алгоритмы. Без единого шага обучения весов.

И это работает. Три силы трансформера, переплавленные в чистый счёт:

▸ Память модели (FFN) → n-gram таблицы. Буквально «какой токен чаще шёл после такого контекста». То, что нейросеть прячет в весах, здесь лежит открытым списком, который можно прочитать глазами.

▸ Внимание → induction. Модель ищет в живом тексте самый длинный повтор и копирует то, что шло следом. Никакого обучения - поиск прямо во время ответа.

▸ Мягкое внимание → kNN по прототипам. Один линейный решатель вместо спуска по градиенту.

Сверху - ещё две фигуры. СУБСТРАТ: внешняя сжатая память, где знание живёт не в весах, а снаружи - в 21 миллионе фактов; читатель вырезает ответ дословно из факта, поэтому система почти не выдумывает. И крошечный РУЛЬ - около 97 тысяч обученных параметров, которые смотрят только на сигналы движков и решают, как их смешать. Ни одного токена он не видит.

Итог, который до сих пор удивляет меня самого:

~97 тысяч обученных параметров рулят 2 миллиардами посчитанных токенов - и оно отвечает на вопросы по Википедии. Именем, с первого токена. Кто открыл Уран - Гершель. Длиннейшая река Европы - Волга. Кто изобрёл паровую машину - Уатт. Всё это из 21 миллиона фактов, на обычном процессоре, без единой видеокарты, примерно за секунду.

Зачем всё это? Способность = память × навык. Классические модели впихивают и знание, и навык в одни и те же веса. GLASS кладёт знание СНАРУЖИ - и оставляет весам только тонкий навык управления. А заодно ищет ответ на главный вопрос: что именно в трансформере нельзя заменить счётом? Где проходит та неделимая граница, за которой без обучения градиентом уже никак?

По ссылке - WIKI проекта. Коротко и наглядно:

◆ анатомия из четырёх фигур - Глассформер, Субстрат, Оркестратор и бикамеральный Плетун;
◆ живая анимация «как отвечает бот»: видно нутро - во что превратился вопрос, какие факты подняты и насколько они покрывают запрос, какую сущность вывела система;
◆ как модель росла по частям - один отлитый движок за другим: n-gram → внимание → сходство → лес;
◆ спокойная карта ограничений и направлений: куда это движется дальше.

Проект исследовательский и делается одним человеком. Он открывает не меньше вопросов, чем закрывает - и в этом весь смысл.

👇 Посмотреть, как язык становится прозрачным:
https://claude.ai/code/artifact/346211a0-d5b4-45fd-8626-820ffdd90f3b

Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
👍36🔥1221
дышит! вдох - выдох.
🤔19🔥5🤩3
Доброе утро, синтеты...

У меня, вроде как, просвет в этой жизни начинает виднеться...а вы там как?
🔥234🦄4🤝3
Вы, наверное, соскучились по моему зоопарку моделей. Давайте поговорим про PIR на весь мир) Сейчас будет пост, где объясню положение проекта.
16🔥2🤔2
Я строю языковую модель с нуля - вместе со всем стеком под ней

Обычно «сделал свою модель» означает: взял PyTorch, взял Llama-архитектуру, взял HuggingFace-токенизатор и обучил веса. Я пошёл другим путём - у меня свой каждый этаж этого здания, и это главная особенность проекта.

PromeTorch - мой тензорный фреймворк, написанный с нуля на C++17 и CUDA: около 93 тысяч строк. Свой тензорный движок, свой автоград на сто с лишним backward-функций, свои CUDA-кернелы, оптимизаторы, загрузчики данных, сериализация. Это не обёртка над PyTorch - это параллельная ему реализация, где я контролирую всё: от аллокатора памяти до порядка суммирования градиентов.

> Когда что-то ломается - я чиню не конфиг, а строку в кернеле. Когда что-то медленно - профилирую собственное ядро и ускоряю его: за один день выжал x12 скорости тренировки (chunked-параллельный скан, слияние гейтинга прямо в кернел, TF32/BF16-пути на тензорных ядрах).

PIR - моя архитектура. Это линейная рекуррентная сеть с диагональным селективным сканом - родственник Mamba, RWKV и HGRN, но собственной конструкции: состояние обновляется как

h(t) = g*h(t-1) + v*sigma(gate)


где забывающий гейт g модулируется контентом вокруг зашитого «спектра памяти» - разные каналы забывают с разной скоростью, от считанных токенов до сотен. Сверху - RoPE-позиции, SwiGLU и RMSNorm.

Ключевое отличие от трансформера: никакого внимания и никакого KV-кэша. Стоимость генерации токена - константа: не растёт с длиной контекста ни по времени, ни по памяти. На инференсе вся «оперативная память» модели - 40 векторов состояния по 640 чисел.

Почему это перспективно: трансформер платит за каждый токен перечитыванием всей истории, а PIR несёт историю в сжатом состоянии. Это дешёвый деплой на скромном железе - и здесь вторая особенность проекта: кросс-платформенность, доказанная делом.

Одна и та же архитектура у меня тренируется и работает на NVIDIA A100, на российском Эльбрусе (4x8С2, VLIW-архитектура E2K, из которого я выжал 92% теоретического пика SGEMM) и на нейроускорителе NM Card. Русская модель, обученная на русских текстах моим собственным BPE-токенизатором, на отечественном железе, на собственном фреймворке - вертикаль полностью суверенна: от байтов корпуса до сэмплера.

Что уже сделано, честными цифрами:

- претрейн 117M-параметровой PIR на 2.14 миллиарда токенов русского корпуса - loss 9.8 -> 2.43 за 28 часов на одной A100, целиком на PromeTorch, без PyTorch вообще
- инструктный SFT с loss-маской и выученным EOS-токеном - модель отвечает на вопросы и сама останавливается
- диалоговая версия ведёт мультитёрн-беседу
- параллельно тот же движок исполняет чужие GGUF-модели (Qwen, Gemma, Mistral, DeepSeek) со скоростью до 109 токенов/с на A100 и до 11 токенов/с на Эльбрусе - в разы быстрее llama.cpp на том же железе

И третье - исследовательская прозрачность. Владея каждым слоем, я не гадаю, а измеряю: когда генерация стала распадаться на длинных ответах, я вскрыл модель, померил фактическую память каждого гейта, нашёл перекос спектра в короткую сторону и конструктивную ошибку в разбивке диапазонов - и теперь чиню архитектуру по данным, а не по интуиции.

Такой уровень контроля недоступен в принципе, когда стек чужой.

Куда это ведёт: линейные рекуррентные модели — один из главных фронтиров после трансформеров, и я вхожу в него не потребителем чужих библиотек, а владельцем полного цикла.

Дальше — удлинение памяти состояния, масштабирование и перенос тренировки крупных версий на кластеры отечественных процессоров.

Практическая ценность такого подхода простая:
полный контроль над каждым слоем стека — значит, любую проблему можно довести до строчки кода и исправить, любую платформу —поддержать самому, и ни одна зависимость от внешнего вендора не станет стоп-краном для проекта.

Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥56👏98👍5🕊1
Что отвечает PIR на 117 миллионов параметров?

ЮЗЕР: Столица Франции?
МОДЕЛЬ: Столица Франции – это Париж.


ЮЗЕР: Что такое фотосинтез?
МОДЕЛЬ: Фотосинтез — это процесс, посредством которого растения и некоторые другие организмы преобразуют энергию света в химическую, используя ее для преобразования углекислорода в воду. Этот процесс происходит главным образом из растений…


ЮЗЕР: Напиши короткое стихотворение про зиму.
МОДЕЛЬ: Зима пришла, и я несу зиму, Наслаждаясь радостью.


ЮЗЕР: Мне грустно сегодня.
МОДЕЛЬ: Твоё настроение, я не могу не чувствовать себя таким грустно, как люди.


Моё мнение?

Модель очень необычная, всё новое...ведёт себя пугающе умно местами...и крайне тупо не понятно почему. Буду разбираться, но всегда дело в количестве параметров, но для текущего размера уровень фактологии - шокирующий.


Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥377👍4🕊2
Техножнец
🔷 GLASS - как устроена языковая модель, которую видно насквозь В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает. Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно…
Glassformer + Substrate 16 умеет говорить...надо было просто с другого боку подойти..ёклмн...

[ПОЛЬЗ] Что такое Рагнарёк?

[GLASSFORMER] Миф о Рагнарёке — скандинавский эсхатологический сюжет, описанный в «Старшей Эдде» и «Младшей Эдде» Снорри…
[ПОЛЬЗ] А кто сражается и кто побеждает?

[GLASSFORMER] Рагнарёк — гибель богов и мира, предшествует ему смерть Бальдра и три зимы без лета (Фимбульветр).

[ПОЛЬЗ] А что с миром после битвы? Всё навсегда?

[GLASSFORMER] После этого Рагнарёка мир возрождается: выживают Бальдри Хёд, а также сыновья Тора Магни и Моди, которые получают молот Мьёльнир.


Это просто небольшой хитростью в коде...сейчас к ней дообучение маленького ткача бесед сядет идеально!

Нормально нормально идёт.

Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥33🕊2👏1
This media is not supported in your browser
VIEW IN TELEGRAM
Это я смотрю на свои проекты и думаю какой из них допиливать...
😎12👀6🕊2
Media is too big
VIEW IN TELEGRAM
👏16🤓11🆒4🕊3👍21🔥1🎅1
2👍26👏10❤‍🔥7
This media is not supported in your browser
VIEW IN TELEGRAM
Как проходит мой день сегодня.

В целом: смутно. Но лимб отпустил и вечером уже отстрелялся по делам.

Ночью приступлю к серьёзной доработке. Пора выкладывать новые репозитории.

И обновы про прометорч рассказать.
🔥16👏7🤯3
Так так так...
👍33💯15👨‍💻54🤩1
Доброе утро, синтеты.

Щас буду проверять что там PIR (поставил треню крупнее).

Доводил репы до состояния норм, скоро выложу свои эксперименты.
🔥19🤝5👍3
Настало время на этой неделе протестировать raspred - поднимем модель, попробуем тренировать толпой. Если прокатит - починю остатки глюков и в путь тренировать вместе.
🔥18🤝13👍5
С Raspred много проблем, которые надо будет решать. Координацию как сделать - думаю.
🤔12👍6👏4
Архитектура PIR. Это сложная тема. Поделиться всем обширно - тоже непросто.
Раз вы читаете это сообщение, то высока вероятность того, что у вас подключён некий, так называемый - канал для передачи, позволяющий открывать басурманские сайты. Вот на сайте claude.ai я и запостил свой артефакт.

ПОЧИТАТЬ ПРО PIR

Это было долго, тяжело. Я много раз опускал руки, но вот. По Rukallama сейчас будет тизер таблица проб и ошибок для понимания - там у модели масштаб поболее чем у текущей PIR.

Для примера: PIR (117 млн), RUKALLAMA (853 млн + тяжёлое наследие новой математики)
Я так долго рожаю, т.к. параллельно ещё и живу, выживаю.

Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15142👍1