Техножнец
5.63K subscribers
1.62K photos
272 videos
12 files
890 links
Канал моих увлечений и поделок. Всё ,что я делаю и выкладываю здесь - делается с любовью.

Поддержать канал: https://tbank.ru/cf/8Xnajl01ehm

Поддержать канал: https://yoomoney.ru/fundraise/1C86E2DGIU9.250819
Download Telegram
Log16 память внимание + GRU слои на 715 млн параметров.

Что это?


🧠 Я строю русский ИИ ассистент на своей памяти. Без KV кэша. Показываю, что уже отвечает.

Психанул на одну вещь, которая бесит всех, кто работает с языковыми моделями: KV-кэш.
Та самая штука, из-за которой чем длиннее разговор — тем больше жрётся памяти, и в какой-то момент всё захлёбывается. Контекст «кончается».

Я зашёл с другой стороны и сделал свою архитектуру памяти - ограниченного размера, она не пухнет от длины диалога. Память работает сразу в двух ролях: и как «внимание», и как хранилище. 🧩

⚙️ Чуть техники

Главное отличие от обычных LLM - модель не «думает» в токенах. Токены живут только на входе и выходе. Внутри она оперирует сжатой памятью и вниманием по ней: текст кусками сворачивается в компактные ячейки-векторы, а обученная «голова-читатель» ходит по этим ячейкам и достаёт нужное. Поэтому объём памяти фиксированный, а не растёт с каждым словом.

Сжимает текст в ячейки GRU-энкодер — он превращает чанки в векторы, которые и ложатся в память. Дальше поверх памяти работает attention-голова: GRU отвечает за «упаковку», внимание — за «поиск и достать». Связка GRU + память и есть сердце всей штуки!

Размер модели — 715 миллионов параметров, словарь ~100 000 (свой русский токенизатор). И всё это крутится на обычном CPU. Без ферм, без A100 круглосуточно. На столе. 💻

🪜 Обучал этапами, каждый — отдельная победа:

① научить память быть адресуемой (чтобы по запросу находилась нужная ячейка, а не «средняя по больнице»);
② иерархия — грубый и точный уровни памяти;
③ дословное копирование факта из памяти;
④ двойной режим — отдельно факты, отдельно разговор, с автопереключением;
RLAIF/DPO — полировка диалога.


📦 Датасет: ~32 000 фактов (вопрос → определение), ~104 000 диалогов и ~1,2 млрд токенов русского текста для фактовой базы. Всё на русском, всё локально.

И вот что из этого уже выходит 👇

📚 Факты модель не выдумывает — достаёт из памяти дословно:

▎ — Что такое Россия?
▎ — Россия — многонациональное государство с широким этнокультурным многообразием.
▎ — Что такое Слоны?
▎ — Слоны — самые крупные наземные животные на Земле.
▎ — Что такое Рунет?
▎ — Рунет — русскоязычная часть Интернета.

Это не «нагенерила похоже на правду». Это достала ровно то, что туда положили. Галлюцинаций на фактах — нет by design.


🪄 Самое сочное — авто-память. Говорю модели новый факт прямо в разговоре, без дообучения и перезапуска:
▎ — Запомни: Зурбаган — портовый город из книг Грина.
▎ — Запомнил.
▎ — Что такое Зурбаган?
▎ — Зурбаган — портовый город из книг Грина.
Сказал — запомнила — выдала обратно. Дословно. Среди десятков тысяч других фактов нашла именно этот. 🎯

Только это не часть KV кэша, который растёт как уровень углекислого газа в тесной бане...а часть постоянной памяти. потому что разговор вмешивается в общую память и разные её части помнят то, что нужно. (тут тоже была отдельная история)


💬 С разговором сложнее, и врать не буду. Болтовню сейчас полирую через RLAIF/DPO — другой сильный ИИ пишет эталонные ответы, а моя модель тянется к ним. Это первый заход DPO, всего на 500 примерах, местами ещё колбасит. Но проблески — настоящие:

▎ — Мне одиноко.
▎ — Я тут. Если хочешь — могу просто помолчать. Помолчать рядом.

▎ — Как начать бегать по утрам?
▎ — Бег — отличный способ снять стресс. А после работы?

▎ — Спасибо за помощь!
▎ — Если захочешь поговорить — я здесь. Береги себя.


Для модели на CPU, которая отвечает со скоростью 20 токенов в секунду = неплохо. А то, что всю фактологию держит в собственной памяти = возбуждает.

🛠 Что дальше: докатывается большой сбор пар (~3000) и второй, серьёзный заход DPO. После — прогон по открытым русским бенчмаркам 2025, без поблажек, с честным разбором где криво.

Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥5215👍6👏5🕊1
так так так..
🤔123
А что если взять MLP...обучить на MNIST до эталона...а потом каждый слой аккуратно вскрыть и найти мат закономерность и "вытянуть" её. Хммммммм. У меня идея, которая сломала вчера мне мозг, но сегодня уже отработала...ожидайте.
🔥19🤔6🕊2👨‍💻1
Техножнец
А что если взять MLP...обучить на MNIST до эталона...а потом каждый слой аккуратно вскрыть и найти мат закономерность и "вытянуть" её. Хммммммм. У меня идея, которая сломала вчера мне мозг, но сегодня уже отработала...ожидайте.
Как...получается...раскрыть чёрный ящик в стеклянный полностью. закрыть этот странный вопрос непонятного обучения, там и backprop не нужен...backward как таковой уже не так работает...ёмаё
🤔144🕊2🆒1
Техножнец
Как...получается...раскрыть чёрный ящик в стеклянный полностью. закрыть этот странный вопрос непонятного обучения, там и backprop не нужен...backward как таковой уже не так работает...ёмаё
Дело в том, что я уже бОльшую часть сделал...поговорить есть о чём. Причём...бумага уже примерно таковая есть на 2025 год. Но я не уверен, что стоит пока что о ней вести речь. Релевантность остаётся в степени интерпретируемости в схожую область. Оно со стороны кажется, что так...а вот нюансы распадаются на не то, что форки...а на другие вселенные. Каждая из которых гнёт свою линию.

Впрочем...там тоже неплохие успехи. «Lagrange Regressor (LReg)»
👍11🤔432🔥2😱1🕊1🤣11
SETUN II* — троичный AI-процессор, который уже считает на "кремнии*"

Что это вообще


*Название будет сменяться, наследию деваться некуда

Гибрид «CPU + AI-ускоритель» на балансной троичной арифметике. Веса нейросети хранятся не как длинные цепочки из 0 и 1, а как три состояния: −1, 0, +1.

И тут вся соль. Умножение на таком весе вырождается:
× (−1) → вычесть
× 0 → пропустить (а это ~31% всех весов!)
× (+1) → прибавить


Полноценный умножитель не нужен вообще — остаётся только сложение, вычитание или пропуск. А множитель — самая дорогая часть MAC-блока, почти половина его площади (47% площади вычислительной полосы в нашем синтезе). Мы меняем его на «знак + сумматор». Плюс каждый третий вес — ноль, его можно не считать вовсе. Даровая экономия энергии на каждой операции.

"Потомок" советской «Сетуни» (МГУ, 1958) — первого в мире серийного троичного компьютера. Только теперь сегодня на вдохновении это AI-ускоритель, и синтезируется он на стандартных CMOS-ячейках. Цель — Микрон 180 нм. Узел, который Россия контролирует уже сейчас.

Главное: ядро РАБОТАЕТ на FPGA

Не симуляция. Не картинка. Процессор (управляющее ядро + троичная ткань + демон) исполнил программу на живом FPGAGW5AST-138, Tang Mega 138K. Всё прочитано по JTAG, цифры считаны прямо с кремния:

базовый matmul на кремнии — C=[[7,10],[19,22]], сошлось бит-в-бит
1091 такт матмула, точно совпало с gate-симуляцией
демон принял 86% выходов на РЕАЛЬНОМ слое nanoGPT


Самый рискованный шаг — заставить кремний считать троичную математику — уже пройден.

Троичный GPT реально пишет текст
Наш nanoGPT: 4.9 млн параметров, 97% весов троичные, обучен на Шекспире. Генерирует связный текст — с именами персонажей, репликами, пунктуацией. Все его матмулы — это ровно операция нашей ткани (add/sub/skip).

И вот что важно — троичная модель обобщает лучше полноточной:
ТроичныйGPT  4.9M   val loss 1.55   1.49 МБ
fp-бейзлайн 10.8M val loss 1.77 21.6 МБ

Вдвое меньше параметров, в 14 раз меньше памяти — и качество выше. Упрощение до −1/0/+1 работает как встроенная регуляризация: модель хуже «зубрит» и лучше работает на новом.

Демон — спекулятивное умножение

Аппаратный механизм, который предсказывает результат и проверяет догадку «забором» (fence) с гарантией: итоговая ошибка всегда ≤ порога ε. Угадал — пропустили пересчёт. Не угадал — посчитали честно. Скорость без потери точности.
На реальных весах: ε 5% → принято 47% (×1.9) ε 10% → принято 76% (×4.0) ε 20% → принято 95% (×16)

MNIST на нашем RTL-движке


Самую изученную сеть в мире обучили в троичном виде и прогнали потактово на нашем железе:

97.3% точности (fp-бейзлайн 98.0% — разрыв всего 0.7%)
8/8 тест-цифр классифицировано верно
16× меньше памяти весов: 49.6 КБ против 794 КБ

Энергия — где троичность рвёт всех

Энергия на одну операцию (MAC):
CPU AMD Zen fp32 — 650–1250 пДж
Наша ткань @180нм — 25–55 пДж
A100 bf16 @7нм — 3.1 пДж
Наша ткань на изо-узле 7нм — ~0.3 пДж

Уже на 200-180-нм заводе мы экономичнее серверного CPU в разы. Перенеси тот же дизайн на 7 нм — и по энергии на операцию обгоняем A100 примерно в 10 раз. (влажные цифровые мечты - прим. ред.) Выигрыш чисто архитектурный (нет умножителя + 2-битные операнды), он переезжает вместе с техпроцессом.

Архитектура — растёт как LEGO

Кристалл собран из одинаковых тайлов (как у Tenstorrent). Нужно мощнее — добавляешь тайлы, ничего не переписывая. При росте сетки в 4 раза частота держится 77→70 МГц — почти не падает. Один дизайн масштабируется от датчика в часах до стойки в дата-центре.

Где мы сейчас
Самое страшное позади: кремний считает троичную математику, демон ускоряет, модель пишет текст. Дальше — сообщу.


Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥101118😁2🕊2🤔1🤯1
Доброе утро
🤝274🦄2🔥1
Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥21👍322🤔2🤯1
Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥14322🤣1
Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13722🤣1
🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1262🕊1
🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥14421🕊1🤣1
🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1942🕊1🤣1👨‍💻1
Пока что всё.


🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3642🕊1
Заброшенный (необитаемый) муравейник, с характерным конусом над землёй, если залить жидким свинцом и дать время охладиться, а потом аккуратно извлечь, то мы получим интересный узор.

Ну...в MLP слое также...надо только выловить закономерности ;)
🤔144👾32👍1🕊1🤣1😈1
А ведь если присмотреться...
😁10🤝4🕊3🤣2
Что если нейросети можно строить алгоритмически...избегая вообще backprop? Просто зная как строить знания ...прям понимая алгоритм нейросетей и их функционала запоминания и обобщения?
🔥3111🤔10👍5🤣5🤓3🕊1
Привет. Я проснулся в 11...освободился только сейчас.
Синтеты , ну что вы там?
🤣14👌5🤝2🕊1
Тайминг
🤣10🤝5🕊1
Нейросети можно отливать, а не растить

Привет, синтеты. Прозрачные нейросети без обратного распространения — что вышло.

Заброшенный муравейник заливают расплавленным металлом. Металл течёт по тоннелям, застывает — и в руках слепок всей скрытой архитектуры. То, что строилось вслепую месяцами, схвачено в одну форму. И её наконец видно.

Внутри обученной нейросети — та же невидимая геометрия. Только мы её не отливаем, а растим через backprop: десятки тысяч шагов, ошибка ползёт назад, веса медленно сходятся. В конце что-то работает — а как устроено, чёрный ящик.

А что если залить "свинцом"? Обучить сеть один раз как эталон, вскрыть, достать слепок — и понять настолько, чтобы строить такую же напрямую. Зная алгоритм памяти и обобщения, а не подбирая его градиентом.

Я проверил. Читается, воспроизводится.

как примерно?

Берём обученный слой и смотрим, что он делает с данными геометрически. Внутри — две вещи: часть запоминает (камеры памяти), часть обобщает (короткие маршруты между похожими входами). Обе считаются из данных напрямую, замыкающей формулой. Дальше собираешь сеть из готовых «отлитых» блоков — как муравейник из тоннелей.

эталон → вскрытие → извлечение → сборка
(0 шагов backprop)

ЯЗЫК

Прозрачная языковая модель. Учится 13 минут на обычном процессоре, генерирует связный текст, и про каждое слово видно почему оно выбрано.

1.58 - bits/byte (лучше нейро-аналога ~1.9)
13 мин - обучение на CPU
103M - токенов
0 - шагов backprop (вместо него умные шаги обобщения алгоритмические и оптимизированные, в самом конце)


Зрение

90% - качества CNN без обучения
0.60 - точность (эталон 0.665)

Генерация

Прозрачная диффузия. Нашли: «шумочистка» генератора в нужном пространстве ведёт себя линейно — совпадение с обученной моделью 98%. Собрали генератор картинок без backprop, до 512px.

R²0.98 - точность извлечения
0.50 - тест обобщения: рисует новое, не копирует

Где стена — честно (временная)


Память и обобщение отливаются идеально. А вот тонкая различающая способность — последние проценты, что отделяют кошку от собаки — упрямо требует настоящего обучения. (но я уже почти догадался в чём соль)

Бил тремя методами, включая динамические системы. Каждый раз — одна стена. Это не провал, это карта: вот докуда отливается, а здесь начинается то, что пока надо растить. А как растить? + поиск других вариантов? = в активном режиме изучения и решения.

Зачем всё это?


Отлитая сеть — прозрачна насквозь. Каждое решение объяснимо, любой кусок чинится точечно, скрытого сбоя нет по определению. Пока индустрия растит всё более огромные чёрные ящики и молится, чтобы они не сломались — есть другой путь. Не вырастить непонятное. Построить понятное.

В СЛЕДУЮЩЕМ ПОСТЕ БУДУТ ПРИМЕРЫ ГЕНЕРАЦИИ КАРТИНОК И ТЕКСТОВ!

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥2687👍2🕊1🤣1🤝1
SHAKESPEARE · char-level · 0 backprop · loss 1.76
ROMEO:
Pardon is banished\'?

FRIAR PETER:
O, I cry you mean not hear me bridle passing merry dump, to comforts. Sir, the sold the envious?

Nurse:
Hie to your cousin too, and the king should say, in a fiery car, gives in fame, a name as rank offend me they have been great subsidies.


FINEWEB · BPE vocab 100k · 0 backprop · 1.58 bits/byte
GEN: "The history of the world, a speaker system. The same applies to a lot of different things like... The researchers, and health care workers."

GEN: "In science, the most important factors in a more accurate representation of the human soul..."


Это результаты работы Glassformer'a! Абсолютно прозрачный алгоритмический трансформер.

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
7🤣3🔥1🕊1🏆1