Затянулось, т.к. параллельно жизнь + поспать. А то сутки почти на ногах был. Делаю открытую мини wiki проекта Glassformer + Substrate 16 + ALU ткач.
❤14🤝5 1
🔷 GLASS - как устроена языковая модель, которую видно насквозь
В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает.
Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно так, не скажет никто, включая её авторов. GLASS - попытка сделать наоборот. Гипотеза простая и дерзкая:
трансформер - не монолит. Его механизмы можно ОТЛИТЬ в прозрачные алгоритмы. Без единого шага обучения весов.
И это работает. Три силы трансформера, переплавленные в чистый счёт:
▸ Память модели (FFN) → n-gram таблицы. Буквально «какой токен чаще шёл после такого контекста». То, что нейросеть прячет в весах, здесь лежит открытым списком, который можно прочитать глазами.
▸ Внимание → induction. Модель ищет в живом тексте самый длинный повтор и копирует то, что шло следом. Никакого обучения - поиск прямо во время ответа.
▸ Мягкое внимание → kNN по прототипам. Один линейный решатель вместо спуска по градиенту.
Сверху - ещё две фигуры. СУБСТРАТ: внешняя сжатая память, где знание живёт не в весах, а снаружи - в 21 миллионе фактов; читатель вырезает ответ дословно из факта, поэтому система почти не выдумывает. И крошечный РУЛЬ - около 97 тысяч обученных параметров, которые смотрят только на сигналы движков и решают, как их смешать. Ни одного токена он не видит.
Итог, который до сих пор удивляет меня самого:
~97 тысяч обученных параметров рулят 2 миллиардами посчитанных токенов - и оно отвечает на вопросы по Википедии. Именем, с первого токена. Кто открыл Уран - Гершель. Длиннейшая река Европы - Волга. Кто изобрёл паровую машину - Уатт. Всё это из 21 миллиона фактов, на обычном процессоре, без единой видеокарты, примерно за секунду.
Зачем всё это? Способность = память × навык. Классические модели впихивают и знание, и навык в одни и те же веса. GLASS кладёт знание СНАРУЖИ - и оставляет весам только тонкий навык управления. А заодно ищет ответ на главный вопрос: что именно в трансформере нельзя заменить счётом? Где проходит та неделимая граница, за которой без обучения градиентом уже никак?
По ссылке - WIKI проекта. Коротко и наглядно:
◆ анатомия из четырёх фигур - Глассформер, Субстрат, Оркестратор и бикамеральный Плетун;
◆ живая анимация «как отвечает бот»: видно нутро - во что превратился вопрос, какие факты подняты и насколько они покрывают запрос, какую сущность вывела система;
◆ как модель росла по частям - один отлитый движок за другим: n-gram → внимание → сходство → лес;
◆ спокойная карта ограничений и направлений: куда это движется дальше.
Проект исследовательский и делается одним человеком. Он открывает не меньше вопросов, чем закрывает - и в этом весь смысл.
👇 Посмотреть, как язык становится прозрачным:
https://claude.ai/code/artifact/346211a0-d5b4-45fd-8626-820ffdd90f3b
🦆 🦆 🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:[email protected]
Поддержать канал: USDT(trc20)
Поддержать канал: BITCOIN
В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает.
Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно так, не скажет никто, включая её авторов. GLASS - попытка сделать наоборот. Гипотеза простая и дерзкая:
трансформер - не монолит. Его механизмы можно ОТЛИТЬ в прозрачные алгоритмы. Без единого шага обучения весов.
И это работает. Три силы трансформера, переплавленные в чистый счёт:
▸ Память модели (FFN) → n-gram таблицы. Буквально «какой токен чаще шёл после такого контекста». То, что нейросеть прячет в весах, здесь лежит открытым списком, который можно прочитать глазами.
▸ Внимание → induction. Модель ищет в живом тексте самый длинный повтор и копирует то, что шло следом. Никакого обучения - поиск прямо во время ответа.
▸ Мягкое внимание → kNN по прототипам. Один линейный решатель вместо спуска по градиенту.
Сверху - ещё две фигуры. СУБСТРАТ: внешняя сжатая память, где знание живёт не в весах, а снаружи - в 21 миллионе фактов; читатель вырезает ответ дословно из факта, поэтому система почти не выдумывает. И крошечный РУЛЬ - около 97 тысяч обученных параметров, которые смотрят только на сигналы движков и решают, как их смешать. Ни одного токена он не видит.
Итог, который до сих пор удивляет меня самого:
~97 тысяч обученных параметров рулят 2 миллиардами посчитанных токенов - и оно отвечает на вопросы по Википедии. Именем, с первого токена. Кто открыл Уран - Гершель. Длиннейшая река Европы - Волга. Кто изобрёл паровую машину - Уатт. Всё это из 21 миллиона фактов, на обычном процессоре, без единой видеокарты, примерно за секунду.
Зачем всё это? Способность = память × навык. Классические модели впихивают и знание, и навык в одни и те же веса. GLASS кладёт знание СНАРУЖИ - и оставляет весам только тонкий навык управления. А заодно ищет ответ на главный вопрос: что именно в трансформере нельзя заменить счётом? Где проходит та неделимая граница, за которой без обучения градиентом уже никак?
По ссылке - WIKI проекта. Коротко и наглядно:
◆ анатомия из четырёх фигур - Глассформер, Субстрат, Оркестратор и бикамеральный Плетун;
◆ живая анимация «как отвечает бот»: видно нутро - во что превратился вопрос, какие факты подняты и насколько они покрывают запрос, какую сущность вывела система;
◆ как модель росла по частям - один отлитый движок за другим: n-gram → внимание → сходство → лес;
◆ спокойная карта ограничений и направлений: куда это движется дальше.
Проект исследовательский и делается одним человеком. Он открывает не меньше вопросов, чем закрывает - и в этом весь смысл.
👇 Посмотреть, как язык становится прозрачным:
https://claude.ai/code/artifact/346211a0-d5b4-45fd-8626-820ffdd90f3b
Не забывайте поддерживать канал:Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7Please open Telegram to view this post
VIEW IN TELEGRAM
👍36🔥12❤2 1
Доброе утро, синтеты...
У меня, вроде как, просвет в этой жизни начинает виднеться...а вы там как?
У меня, вроде как, просвет в этой жизни начинает виднеться...а вы там как?
🔥23❤4🦄4🤝3
Вы, наверное, соскучились по моему зоопарку моделей. Давайте поговорим про PIR на весь мир) Сейчас будет пост, где объясню положение проекта.
❤16🔥2🤔2
Я строю языковую модель с нуля - вместе со всем стеком под ней
Обычно «сделал свою модель» означает: взял PyTorch, взял Llama-архитектуру, взял HuggingFace-токенизатор и обучил веса. Я пошёл другим путём - у меня свой каждый этаж этого здания, и это главная особенность проекта.
PromeTorch - мой тензорный фреймворк, написанный с нуля на
> Когда что-то ломается - я чиню не конфиг, а строку в кернеле. Когда что-то медленно - профилирую собственное ядро и ускоряю его: за один день выжал x12 скорости тренировки (chunked-параллельный скан, слияние гейтинга прямо в кернел, TF32/BF16-пути на тензорных ядрах).
PIR - моя архитектура. Это линейная рекуррентная сеть с диагональным селективным сканом - родственник Mamba, RWKV и HGRN, но собственной конструкции: состояние обновляется как
где забывающий гейт
Ключевое отличие от трансформера: никакого внимания и никакого KV-кэша. Стоимость генерации токена - константа: не растёт с длиной контекста ни по времени, ни по памяти. На инференсе вся «оперативная память» модели - 40 векторов состояния по 640 чисел.
Почему это перспективно: трансформер платит за каждый токен перечитыванием всей истории, а PIR несёт историю в сжатом состоянии. Это дешёвый деплой на скромном железе - и здесь вторая особенность проекта: кросс-платформенность, доказанная делом.
Одна и та же архитектура у меня тренируется и работает на NVIDIA A100, на российском Эльбрусе (4x8С2, VLIW-архитектура E2K, из которого я выжал 92% теоретического пика SGEMM) и на нейроускорителе NM Card. Русская модель, обученная на русских текстах моим собственным BPE-токенизатором, на отечественном железе, на собственном фреймворке - вертикаль полностью суверенна: от байтов корпуса до сэмплера.
Что уже сделано, честными цифрами:
- претрейн 117M-параметровой PIR на 2.14 миллиарда токенов русского корпуса - loss
- инструктный SFT с loss-маской и выученным EOS-токеном - модель отвечает на вопросы и сама останавливается
- диалоговая версия ведёт мультитёрн-беседу
- параллельно тот же движок исполняет чужие GGUF-модели (Qwen, Gemma, Mistral, DeepSeek) со скоростью до 109 токенов/с на A100 и до 11 токенов/с на Эльбрусе - в разы быстрее llama.cpp на том же железе
И третье - исследовательская прозрачность. Владея каждым слоем, я не гадаю, а измеряю: когда генерация стала распадаться на длинных ответах, я вскрыл модель, померил фактическую память каждого гейта, нашёл перекос спектра в короткую сторону и конструктивную ошибку в разбивке диапазонов - и теперь чиню архитектуру по данным, а не по интуиции.
Такой уровень контроля недоступен в принципе, когда стек чужой.
Дальше — удлинение памяти состояния, масштабирование и перенос тренировки крупных версий на кластеры отечественных процессоров.
полный контроль над каждым слоем стека — значит, любую проблему можно довести до строчки кода и исправить, любую платформу —поддержать самому, и ни одна зависимость от внешнего вендора не станет стоп-краном для проекта.
Не забывайте поддерживать канал:
🦆 🦆 🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:[email protected]
Поддержать канал: USDT(trc20)
Поддержать канал: BITCOIN
Обычно «сделал свою модель» означает: взял PyTorch, взял Llama-архитектуру, взял HuggingFace-токенизатор и обучил веса. Я пошёл другим путём - у меня свой каждый этаж этого здания, и это главная особенность проекта.
PromeTorch - мой тензорный фреймворк, написанный с нуля на
C++17 и CUDA: около 93 тысяч строк. Свой тензорный движок, свой автоград на сто с лишним backward-функций, свои CUDA-кернелы, оптимизаторы, загрузчики данных, сериализация. Это не обёртка над PyTorch - это параллельная ему реализация, где я контролирую всё: от аллокатора памяти до порядка суммирования градиентов.> Когда что-то ломается - я чиню не конфиг, а строку в кернеле. Когда что-то медленно - профилирую собственное ядро и ускоряю его: за один день выжал x12 скорости тренировки (chunked-параллельный скан, слияние гейтинга прямо в кернел, TF32/BF16-пути на тензорных ядрах).
PIR - моя архитектура. Это линейная рекуррентная сеть с диагональным селективным сканом - родственник Mamba, RWKV и HGRN, но собственной конструкции: состояние обновляется как
h(t) = g*h(t-1) + v*sigma(gate)
где забывающий гейт
g модулируется контентом вокруг зашитого «спектра памяти» - разные каналы забывают с разной скоростью, от считанных токенов до сотен. Сверху - RoPE-позиции, SwiGLU и RMSNorm.Ключевое отличие от трансформера: никакого внимания и никакого KV-кэша. Стоимость генерации токена - константа: не растёт с длиной контекста ни по времени, ни по памяти. На инференсе вся «оперативная память» модели - 40 векторов состояния по 640 чисел.
Почему это перспективно: трансформер платит за каждый токен перечитыванием всей истории, а PIR несёт историю в сжатом состоянии. Это дешёвый деплой на скромном железе - и здесь вторая особенность проекта: кросс-платформенность, доказанная делом.
Одна и та же архитектура у меня тренируется и работает на NVIDIA A100, на российском Эльбрусе (4x8С2, VLIW-архитектура E2K, из которого я выжал 92% теоретического пика SGEMM) и на нейроускорителе NM Card. Русская модель, обученная на русских текстах моим собственным BPE-токенизатором, на отечественном железе, на собственном фреймворке - вертикаль полностью суверенна: от байтов корпуса до сэмплера.
Что уже сделано, честными цифрами:
- претрейн 117M-параметровой PIR на 2.14 миллиарда токенов русского корпуса - loss
9.8 -> 2.43 за 28 часов на одной A100, целиком на PromeTorch, без PyTorch вообще- инструктный SFT с loss-маской и выученным EOS-токеном - модель отвечает на вопросы и сама останавливается
- диалоговая версия ведёт мультитёрн-беседу
- параллельно тот же движок исполняет чужие GGUF-модели (Qwen, Gemma, Mistral, DeepSeek) со скоростью до 109 токенов/с на A100 и до 11 токенов/с на Эльбрусе - в разы быстрее llama.cpp на том же железе
И третье - исследовательская прозрачность. Владея каждым слоем, я не гадаю, а измеряю: когда генерация стала распадаться на длинных ответах, я вскрыл модель, померил фактическую память каждого гейта, нашёл перекос спектра в короткую сторону и конструктивную ошибку в разбивке диапазонов - и теперь чиню архитектуру по данным, а не по интуиции.
Куда это ведёт: линейные рекуррентные модели — один из главных фронтиров после трансформеров, и я вхожу в него не потребителем чужих библиотек, а владельцем полного цикла.Дальше — удлинение памяти состояния, масштабирование и перенос тренировки крупных версий на кластеры отечественных процессоров.
Практическая ценность такого подхода простая:полный контроль над каждым слоем стека — значит, любую проблему можно довести до строчки кода и исправить, любую платформу —поддержать самому, и ни одна зависимость от внешнего вендора не станет стоп-краном для проекта.
Не забывайте поддерживать канал:
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7Please open Telegram to view this post
VIEW IN TELEGRAM
🔥56👏9❤8👍5🕊1
Что отвечает PIR на 117 миллионов параметров?
Моё мнение?
Модель очень необычная, всё новое...ведёт себя пугающе умно местами...и крайне тупо не понятно почему. Буду разбираться, но всегда дело в количестве параметров, но для текущего размера уровень фактологии - шокирующий.
Не забывайте поддерживать канал:
🦆 🦆 🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:[email protected]
Поддержать канал: USDT(trc20)
Поддержать канал: BITCOIN
ЮЗЕР: Столица Франции?
МОДЕЛЬ: Столица Франции – это Париж.
ЮЗЕР: Что такое фотосинтез?
МОДЕЛЬ: Фотосинтез — это процесс, посредством которого растения и некоторые другие организмы преобразуют энергию света в химическую, используя ее для преобразования углекислорода в воду. Этот процесс происходит главным образом из растений…
ЮЗЕР: Напиши короткое стихотворение про зиму.
МОДЕЛЬ: Зима пришла, и я несу зиму, Наслаждаясь радостью.
ЮЗЕР: Мне грустно сегодня.
МОДЕЛЬ: Твоё настроение, я не могу не чувствовать себя таким грустно, как люди.
Моё мнение?
Модель очень необычная, всё новое...ведёт себя пугающе умно местами...и крайне тупо не понятно почему. Буду разбираться, но всегда дело в количестве параметров, но для текущего размера уровень фактологии - шокирующий.
Не забывайте поддерживать канал:
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7Please open Telegram to view this post
VIEW IN TELEGRAM
🔥37❤7👍4🕊2
Техножнец
🔷 GLASS - как устроена языковая модель, которую видно насквозь В прошлый раз я показал проект. Теперь - по сути: что это такое и как оно работает. Обычная нейросеть - чёрный ящик. Миллиарды весов, обученных градиентным спуском; почему она ответила именно…
Glassformer + Substrate 16 умеет говорить...надо было просто с другого боку подойти..ёклмн...
Это просто небольшой хитростью в коде...сейчас к ней дообучение маленького ткача бесед сядет идеально!
Нормально нормально идёт.
Не забывайте поддерживать канал:
🦆 🦆 🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:[email protected]
Поддержать канал: USDT(trc20)
Поддержать канал: BITCOIN
[ПОЛЬЗ] Что такое Рагнарёк?
[GLASSFORMER] Миф о Рагнарёке — скандинавский эсхатологический сюжет, описанный в «Старшей Эдде» и «Младшей Эдде» Снорри…
[ПОЛЬЗ] А кто сражается и кто побеждает?
[GLASSFORMER] Рагнарёк — гибель богов и мира, предшествует ему смерть Бальдра и три зимы без лета (Фимбульветр).
[ПОЛЬЗ] А что с миром после битвы? Всё навсегда?
[GLASSFORMER] После этого Рагнарёка мир возрождается: выживают Бальдри Хёд, а также сыновья Тора Магни и Моди, которые получают молот Мьёльнир.
Это просто небольшой хитростью в коде...сейчас к ней дообучение маленького ткача бесед сядет идеально!
Нормально нормально идёт.
Не забывайте поддерживать канал:
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7Please open Telegram to view this post
VIEW IN TELEGRAM
🔥33🕊2👏1
This media is not supported in your browser
VIEW IN TELEGRAM
Это я смотрю на свои проекты и думаю какой из них допиливать...
😎12👀6🕊2
This media is not supported in your browser
VIEW IN TELEGRAM
Как проходит мой день сегодня.
В целом: смутно. Но лимб отпустил и вечером уже отстрелялся по делам.
Ночью приступлю к серьёзной доработке. Пора выкладывать новые репозитории.
И обновы про прометорч рассказать.
В целом: смутно. Но лимб отпустил и вечером уже отстрелялся по делам.
Ночью приступлю к серьёзной доработке. Пора выкладывать новые репозитории.
И обновы про прометорч рассказать.
🔥16👏7🤯3
Доброе утро, синтеты.
Щас буду проверять что там PIR (поставил треню крупнее).
Доводил репы до состояния норм, скоро выложу свои эксперименты.
Щас буду проверять что там PIR (поставил треню крупнее).
Доводил репы до состояния норм, скоро выложу свои эксперименты.
🔥19🤝5👍3
Настало время на этой неделе протестировать raspred - поднимем модель, попробуем тренировать толпой. Если прокатит - починю остатки глюков и в путь тренировать вместе.
🔥18🤝13👍5
С Raspred много проблем, которые надо будет решать. Координацию как сделать - думаю.
🤔12👍6👏4
Архитектура PIR. Это сложная тема. Поделиться всем обширно - тоже непросто. Раз вы читаете это сообщение, то высока вероятность того, что у вас подключён некий, так называемый - канал для передачи, позволяющий открывать басурманские сайты. Вот на сайте claude.ai я и запостил свой артефакт.
ПОЧИТАТЬ ПРО PIR
Это было долго, тяжело. Я много раз опускал руки, но вот. По Rukallama сейчас будет тизер таблица проб и ошибок для понимания - там у модели масштаб поболее чем у текущей PIR.
Для примера: PIR (117 млн), RUKALLAMA (853 млн +
Я так долго рожаю, т.к. параллельно ещё и живу, выживаю.
Не забывайте поддерживать канал:
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15❤14 2👍1
Как обстоят дела с Rukallama и почему "задерживалось"...хотя тут кипела работа. Очень приятно подводить итоги...из-за масштабов и того, что приходилось жанглировать между Google Colab и своей картой - карта одна, моделей куча = время затягивалось.Не забывайте поддерживать канал:
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7Please open Telegram to view this post
VIEW IN TELEGRAM
🔥17❤3👍1