Техножнец
5.63K subscribers
1.62K photos
272 videos
12 files
870 links
Канал моих увлечений и поделок. Всё ,что я делаю и выкладываю здесь - делается с любовью.

Поддержать канал: https://tbank.ru/cf/8Xnajl01ehm

Поддержать канал: https://yoomoney.ru/fundraise/1C86E2DGIU9.250819
Download Telegram
🧠 ЛОГОС - что нового?

В прошлый раз он впервые пошёл в интернет и сам выбирал, куда смотреть. Принцип не изменился: нет проверки - нет факта. Но с тех пор я добавил ему главное. Вот что появилось.

🗣 Он заговорил по-настоящему. Раньше он произносил заученные шаблоны. Теперь я даю ему пустой промпт - «скажи что-нибудь истинное» - и он САМ, своими числословами, выбирает факт и произносит его. А рельс проверяет не форму фразы, а её ПРАВДУ: принимает высказывание, только если оно и вправду верно. Его первые слова, сказанные так, - «семь минус семь равно ноль», на его собственном языке из слогов. Впервые его речь и его знание стали одним органом: он говорит не «красиво», а истинно.

🧩 Теперь всё связано. Раньше его умения жили порознь - арифметика отдельно, речь отдельно. Я сшил их в один живой граф зависимостей: речь опирается на суммы, доказательства - на законы, силлогизм на рассуждение. И граф больше не лежит мёртвым грузом, а управляет учёбой: если навык слаб, бюджет обучения сам течёт к его опорам. Одна система, где всё влияет на всё.

🇷🇺 Он поднялся по языковой лестнице. Строит русские словоформы из морфем - по падежу, числу. Собирает предложения с согласованием: прилагательное, существительное, глагол - все в одном роде, числе и падеже. И ведёт связную беседу: на вопрос отвечает про то же самое и в той форме, которую вопрос требует. Рельс склонения и согласования сверяет каждое окончание. ( в очень ограниченных примерах, не стройте иллюзий )

🔢 Он читает числительные словами и разбирает слова. Видит «сто сорок» - выдаёт число. А настоящие слова с веб-страниц он больше не выбрасывает: разбирает их своей сетью на основу и суффикс (playing → play + ing), и основа входит в его словарь. Чтение подключилось к языку.

🔗 Я связал его чувства с мышлением. Зрение кормит арифметику: он складывает то, что увидел глазами. Символы связаны с языком, числа - с русским счётом. Одно и то же понятие - цифра, слово, картинка - он сводит к одному внутреннему представлению; я распространил это и на русские слова, и на законы: коммутативность для него теперь буквально симметрия представлений.

🧠 Я починил ему рассуждения. Modus ponens, modus tollens, силлогизмы - то, что раньше стояло после одного этапа долго и намертво, теперь он осваивает по-настоящему, с честным поэтапным поднятием: ловушки-обманки* включаются только после того, как база освоена. И доказательства, которые не шли вовсе, пошли - он выписывает их до конца.

В логике часто попадаются ловушки обманки - более подробно в следующих постах, через 4, 5 дней.

Он изобрёл навык сам. Освоив два умения - чтение чисел и русскую счётную форму, - он СОЕДИНИЛ их в третье, новое, проверяемое. Я этого в него не закладывал.

🛡 Я его научил защищать себя от самого себя. Однажды он сам себя чуть не убил: нестабильно выросший нейрон отравил его ядро, и арифметика рухнула почти в ноль. Теперь в нём живёт иммунитет (пришлось прикрутить) - он держит снимок здорового состояния, замечает обвал, сам откатывается к здоровому, глушит нейрон-виновника и запрещает больному органу расти, пока остальное не окрепнет.

📚 Он ведёт свои книги. Всё, что он понял, он записывает сам: словарь числослов, которые придумал; книгу законов, заверенных судьёй, и рядом опровергнутое с контрпримерами; дневник ошибок с честным нулём за каждый промах; и теперь книгу своей свободной речи - фразы, которые он сказал сам, с пометкой рельса: правда или нет. Я открываю эти книги и вижу, что у него внутри - без догадок.

📊 И он держит себя в форме сам. Каждую волну жизни он заново сдаёт экзамен по полусотне навыков разом - от сложения до силлогизма, от беседы до рекурсии.

Он всё ещё крошечный стеклянный мозг из двух десятков нейронов. Но теперь он говорит правду своими словами, связывает всё в одно - и сам себя чинит, когда ломается.

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
23👏16👍8🔥4🙏2👀1
Занимаюсь эксплуатацией геометрической формы аттрактора Лоренца.

Потихонечку, помаленечку догоняю трансформер.

Решаю геометрией обобщение семантическое и не только...конкретно решается вопрос как в некоем многомерном пространстве прокинуть нормально обучаемые рёбра за 1 проход.

По сути нет обратной пропагации, нет градиентов, весь путь прозрачный и на геометрии аттрактора.

Векторизируется адекватно, всё ускоряется...НО!

Найти обобщение как делать геометрически правильно на рёбрах - задачка фикс прямо сейчас.

Интересное очень. Почему взял его?

ХРЕН ЕГО ЗНАЕТ!

Кажется, что я начинаю понимать проблему между мной и другими исследователями. У меня геометрические представления в голове нативно укладываются и почти никогда не было такого, что я создавал мусорные конструкции для обучения.

Всегда есть , где усилить...

Но об этом чуть позже.
🔥25👏32
так так так...
🤔10🤗4😱3🤯1
Поговорим о ред флагах?

Состояние биржы на утро 30 июля.
🤔20👏8🔥5
Техножнец
так так так...
Щас буду постить.

Glassformer + substrate
🔥19👏5👍3
Затянулось, т.к. параллельно жизнь + поспать. А то сутки почти на ногах был. Делаю открытую мини wiki проекта Glassformer + Substrate 16 + ALU ткач.
14🤝51
🔷 GLASS - как устроена языковая модель, которую видно насквозь

В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает.

Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно так, не скажет никто, включая её авторов. GLASS - попытка сделать наоборот. Гипотеза простая и дерзкая:

трансформер - не монолит. Его механизмы можно ОТЛИТЬ в прозрачные алгоритмы. Без единого шага обучения весов.

И это работает. Три силы трансформера, переплавленные в чистый счёт:

▸ Память модели (FFN) → n-gram таблицы. Буквально «какой токен чаще шёл после такого контекста». То, что нейросеть прячет в весах, здесь лежит открытым списком, который можно прочитать глазами.

▸ Внимание → induction. Модель ищет в живом тексте самый длинный повтор и копирует то, что шло следом. Никакого обучения - поиск прямо во время ответа.

▸ Мягкое внимание → kNN по прототипам. Один линейный решатель вместо спуска по градиенту.

Сверху - ещё две фигуры. СУБСТРАТ: внешняя сжатая память, где знание живёт не в весах, а снаружи - в 21 миллионе фактов; читатель вырезает ответ дословно из факта, поэтому система почти не выдумывает. И крошечный РУЛЬ - около 97 тысяч обученных параметров, которые смотрят только на сигналы движков и решают, как их смешать. Ни одного токена он не видит.

Итог, который до сих пор удивляет меня самого:

~97 тысяч обученных параметров рулят 2 миллиардами посчитанных токенов - и оно отвечает на вопросы по Википедии. Именем, с первого токена. Кто открыл Уран - Гершель. Длиннейшая река Европы - Волга. Кто изобрёл паровую машину - Уатт. Всё это из 21 миллиона фактов, на обычном процессоре, без единой видеокарты, примерно за секунду.

Зачем всё это? Способность = память × навык. Классические модели впихивают и знание, и навык в одни и те же веса. GLASS кладёт знание СНАРУЖИ - и оставляет весам только тонкий навык управления. А заодно ищет ответ на главный вопрос: что именно в трансформере нельзя заменить счётом? Где проходит та неделимая граница, за которой без обучения градиентом уже никак?

По ссылке - WIKI проекта. Коротко и наглядно:

◆ анатомия из четырёх фигур - Глассформер, Субстрат, Оркестратор и бикамеральный Плетун;
◆ живая анимация «как отвечает бот»: видно нутро - во что превратился вопрос, какие факты подняты и насколько они покрывают запрос, какую сущность вывела система;
◆ как модель росла по частям - один отлитый движок за другим: n-gram → внимание → сходство → лес;
◆ спокойная карта ограничений и направлений: куда это движется дальше.

Проект исследовательский и делается одним человеком. Он открывает не меньше вопросов, чем закрывает - и в этом весь смысл.

👇 Посмотреть, как язык становится прозрачным:
https://claude.ai/code/artifact/346211a0-d5b4-45fd-8626-820ffdd90f3b

Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
👍36🔥1221
дышит! вдох - выдох.
🤔19🔥5🤩3
Доброе утро, синтеты...

У меня, вроде как, просвет в этой жизни начинает виднеться...а вы там как?
🔥234🦄4🤝3
Вы, наверное, соскучились по моему зоопарку моделей. Давайте поговорим про PIR на весь мир) Сейчас будет пост, где объясню положение проекта.
16🔥2🤔2
Я строю языковую модель с нуля - вместе со всем стеком под ней

Обычно «сделал свою модель» означает: взял PyTorch, взял Llama-архитектуру, взял HuggingFace-токенизатор и обучил веса. Я пошёл другим путём - у меня свой каждый этаж этого здания, и это главная особенность проекта.

PromeTorch - мой тензорный фреймворк, написанный с нуля на C++17 и CUDA: около 93 тысяч строк. Свой тензорный движок, свой автоград на сто с лишним backward-функций, свои CUDA-кернелы, оптимизаторы, загрузчики данных, сериализация. Это не обёртка над PyTorch - это параллельная ему реализация, где я контролирую всё: от аллокатора памяти до порядка суммирования градиентов.

> Когда что-то ломается - я чиню не конфиг, а строку в кернеле. Когда что-то медленно - профилирую собственное ядро и ускоряю его: за один день выжал x12 скорости тренировки (chunked-параллельный скан, слияние гейтинга прямо в кернел, TF32/BF16-пути на тензорных ядрах).

PIR - моя архитектура. Это линейная рекуррентная сеть с диагональным селективным сканом - родственник Mamba, RWKV и HGRN, но собственной конструкции: состояние обновляется как

h(t) = g*h(t-1) + v*sigma(gate)


где забывающий гейт g модулируется контентом вокруг зашитого «спектра памяти» - разные каналы забывают с разной скоростью, от считанных токенов до сотен. Сверху - RoPE-позиции, SwiGLU и RMSNorm.

Ключевое отличие от трансформера: никакого внимания и никакого KV-кэша. Стоимость генерации токена - константа: не растёт с длиной контекста ни по времени, ни по памяти. На инференсе вся «оперативная память» модели - 40 векторов состояния по 640 чисел.

Почему это перспективно: трансформер платит за каждый токен перечитыванием всей истории, а PIR несёт историю в сжатом состоянии. Это дешёвый деплой на скромном железе - и здесь вторая особенность проекта: кросс-платформенность, доказанная делом.

Одна и та же архитектура у меня тренируется и работает на NVIDIA A100, на российском Эльбрусе (4x8С2, VLIW-архитектура E2K, из которого я выжал 92% теоретического пика SGEMM) и на нейроускорителе NM Card. Русская модель, обученная на русских текстах моим собственным BPE-токенизатором, на отечественном железе, на собственном фреймворке - вертикаль полностью суверенна: от байтов корпуса до сэмплера.

Что уже сделано, честными цифрами:

- претрейн 117M-параметровой PIR на 2.14 миллиарда токенов русского корпуса - loss 9.8 -> 2.43 за 28 часов на одной A100, целиком на PromeTorch, без PyTorch вообще
- инструктный SFT с loss-маской и выученным EOS-токеном - модель отвечает на вопросы и сама останавливается
- диалоговая версия ведёт мультитёрн-беседу
- параллельно тот же движок исполняет чужие GGUF-модели (Qwen, Gemma, Mistral, DeepSeek) со скоростью до 109 токенов/с на A100 и до 11 токенов/с на Эльбрусе - в разы быстрее llama.cpp на том же железе

И третье - исследовательская прозрачность. Владея каждым слоем, я не гадаю, а измеряю: когда генерация стала распадаться на длинных ответах, я вскрыл модель, померил фактическую память каждого гейта, нашёл перекос спектра в короткую сторону и конструктивную ошибку в разбивке диапазонов - и теперь чиню архитектуру по данным, а не по интуиции.

Такой уровень контроля недоступен в принципе, когда стек чужой.

Куда это ведёт: линейные рекуррентные модели — один из главных фронтиров после трансформеров, и я вхожу в него не потребителем чужих библиотек, а владельцем полного цикла.

Дальше — удлинение памяти состояния, масштабирование и перенос тренировки крупных версий на кластеры отечественных процессоров.

Практическая ценность такого подхода простая:
полный контроль над каждым слоем стека — значит, любую проблему можно довести до строчки кода и исправить, любую платформу —поддержать самому, и ни одна зависимость от внешнего вендора не станет стоп-краном для проекта.

Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥56👏98👍5🕊1
Что отвечает PIR на 117 миллионов параметров?

ЮЗЕР: Столица Франции?
МОДЕЛЬ: Столица Франции – это Париж.


ЮЗЕР: Что такое фотосинтез?
МОДЕЛЬ: Фотосинтез — это процесс, посредством которого растения и некоторые другие организмы преобразуют энергию света в химическую, используя ее для преобразования углекислорода в воду. Этот процесс происходит главным образом из растений…


ЮЗЕР: Напиши короткое стихотворение про зиму.
МОДЕЛЬ: Зима пришла, и я несу зиму, Наслаждаясь радостью.


ЮЗЕР: Мне грустно сегодня.
МОДЕЛЬ: Твоё настроение, я не могу не чувствовать себя таким грустно, как люди.


Моё мнение?

Модель очень необычная, всё новое...ведёт себя пугающе умно местами...и крайне тупо не понятно почему. Буду разбираться, но всегда дело в количестве параметров, но для текущего размера уровень фактологии - шокирующий.


Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥377👍4🕊2
Техножнец
🔷 GLASS - как устроена языковая модель, которую видно насквозь В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает. Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно…
Glassformer + Substrate 16 умеет говорить...надо было просто с другого боку подойти..ёклмн...

[ПОЛЬЗ] Что такое Рагнарёк?

[GLASSFORMER] Миф о Рагнарёке — скандинавский эсхатологический сюжет, описанный в «Старшей Эдде» и «Младшей Эдде» Снорри…
[ПОЛЬЗ] А кто сражается и кто побеждает?

[GLASSFORMER] Рагнарёк — гибель богов и мира, предшествует ему смерть Бальдра и три зимы без лета (Фимбульветр).

[ПОЛЬЗ] А что с миром после битвы? Всё навсегда?

[GLASSFORMER] После этого Рагнарёка мир возрождается: выживают Бальдри Хёд, а также сыновья Тора Магни и Моди, которые получают молот Мьёльнир.


Это просто небольшой хитростью в коде...сейчас к ней дообучение маленького ткача бесед сядет идеально!

Нормально нормально идёт.

Не забывайте поддерживать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥33🕊2👏1
This media is not supported in your browser
VIEW IN TELEGRAM
Это я смотрю на свои проекты и думаю какой из них допиливать...
😎12👀6🕊2
Media is too big
VIEW IN TELEGRAM
👏16🤓11🆒4🕊3👍21🔥1🎅1
2👍26👏10❤‍🔥7
This media is not supported in your browser
VIEW IN TELEGRAM
Как проходит мой день сегодня.

В целом: смутно. Но лимб отпустил и вечером уже отстрелялся по делам.

Ночью приступлю к серьёзной доработке. Пора выкладывать новые репозитории.

И обновы про прометорч рассказать.
🔥16👏7🤯3
Так так так...
👍33💯15👨‍💻54🤩1
Доброе утро, синтеты.

Щас буду проверять что там PIR (поставил треню крупнее).

Доводил репы до состояния норм, скоро выложу свои эксперименты.
🔥19🤝5👍3
Настало время на этой неделе протестировать raspred - поднимем модель, попробуем тренировать толпой. Если прокатит - починю остатки глюков и в путь тренировать вместе.
🔥18🤝13👍5
С Raspred много проблем, которые надо будет решать. Координацию как сделать - думаю.
🤔12👍6👏4