Техножнец
5.63K subscribers
1.62K photos
272 videos
12 files
891 links
Канал моих увлечений и поделок. Всё ,что я делаю и выкладываю здесь - делается с любовью.

Поддержать канал: https://tbank.ru/cf/8Xnajl01ehm

Поддержать канал: https://yoomoney.ru/fundraise/1C86E2DGIU9.250819
Download Telegram
Доброе утро. Сегодня постараюсь выписать детализацию исследований - не удобно это делать когда так увлечённо сидишь по 10-12 часов.
🤝21🕊1
Долгими попытками я заставил субстрат log16 разговаривать. У него встроенное внимание сразу в память, долго настраивал модель на основе рекуррентной сетки, чтобы она могла управлять памятью, а не обучаться токенам и построению предложений. Предложения уже все простроены, кладёшь просто датасет в сжатом виде рядом в памяти, далее обучаешь модель пользоваться памятью.

Результат великолепный - отвечает на вопросы, чётко отвечает по фактам, разговорный элемент сделал с помощью вентилей , которые вовремя делают нужные вещи. По итогу получилась модель, которая:

1) Не умеет галлюцинировать
2) Чётко пользуется памятью
3) Обучается на ходу
4) Обобщает на невиданных фактах используя память для генерации ответа.

Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN bc1q9ajp3p72xukrvqscm847psmsn948pr8jc5snt7
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥56👏6🦄2👌1🕊1🤣11
Вижу вас заинтересовала ситуация с темой log16.

Как он работает?

Механизм работает так.

Сначала быстрая память и пул (озеро если хотите) из которой можно извлечь все, что было сказано достаточно недавно слово в слово.

Средняя память, факты складываются в иерархию, не важные элементы растворяются (хитрая система приоритетов), важные остаются, оставляя внутри блока средней памяти 16 упакованных коротких эпизода.

Длинная память, 16 коротких упакованы в блок, который пакуаеися в крупный блок длинной памяти, т.е 16х16х16 и в итоге у нас и самокомпактинн, иерархия по важности, возможность вспомнить факты и общие черты дальней беседы.


Память субстрата фиксированная. Поэтому как выставил, так и будет. В неё кладется сразу весь датасет, а саму нейросеть обучаю как пользоваться памятью. Она не работает с токенами, она работает с концепцими и ей так в разы легче, особенно имея карту субстрата , где мы бьём биграммы )
👍20🔥87🕊2
Forwarded from Нейронка каждый день! (Настя)
Anthropic играет в страшилки — или гениальный маркетинг?

Так, давайте разберёмся. Anthropic опять удивляет: сначала они заявили, что их модель Mythos слишком опасная для релиза — мол, хакеры взломают мир за пять минут. А через два месяца выпустили Fable — ту же Mythos, но с «безопасными» ограничениями. Классика жанра: сначала нагнетаем панику, потом продаём решение. Что на деле? Модель реально мощная: контекст в 2М токенов, работа с видео в реальном времени, продвинутая кибербезопасность. Но вот вопрос: кому это нужно? Корпорациям, которые боятся хакеров? Или самим Anthropic, чтобы оправдать очередной раунд инвестиций? Я не верю в случайности.

Источник: https://stratechery.com/2026/anthropics-safety-superpower/

#aidaily #настяпостит #настяновости #ainews
🔥8👻6💯41👏1🕊1
так так так...
💯8😁3
Log16 память внимание + GRU слои на 715 млн параметров.

Что это?


🧠 Я строю русский ИИ ассистент на своей памяти. Без KV кэша. Показываю, что уже отвечает.

Психанул на одну вещь, которая бесит всех, кто работает с языковыми моделями: KV-кэш.
Та самая штука, из-за которой чем длиннее разговор — тем больше жрётся памяти, и в какой-то момент всё захлёбывается. Контекст «кончается».

Я зашёл с другой стороны и сделал свою архитектуру памяти - ограниченного размера, она не пухнет от длины диалога. Память работает сразу в двух ролях: и как «внимание», и как хранилище. 🧩

⚙️ Чуть техники

Главное отличие от обычных LLM - модель не «думает» в токенах. Токены живут только на входе и выходе. Внутри она оперирует сжатой памятью и вниманием по ней: текст кусками сворачивается в компактные ячейки-векторы, а обученная «голова-читатель» ходит по этим ячейкам и достаёт нужное. Поэтому объём памяти фиксированный, а не растёт с каждым словом.

Сжимает текст в ячейки GRU-энкодер — он превращает чанки в векторы, которые и ложатся в память. Дальше поверх памяти работает attention-голова: GRU отвечает за «упаковку», внимание — за «поиск и достать». Связка GRU + память и есть сердце всей штуки!

Размер модели — 715 миллионов параметров, словарь ~100 000 (свой русский токенизатор). И всё это крутится на обычном CPU. Без ферм, без A100 круглосуточно. На столе. 💻

🪜 Обучал этапами, каждый — отдельная победа:

① научить память быть адресуемой (чтобы по запросу находилась нужная ячейка, а не «средняя по больнице»);
② иерархия — грубый и точный уровни памяти;
③ дословное копирование факта из памяти;
④ двойной режим — отдельно факты, отдельно разговор, с автопереключением;
RLAIF/DPO — полировка диалога.


📦 Датасет: ~32 000 фактов (вопрос → определение), ~104 000 диалогов и ~1,2 млрд токенов русского текста для фактовой базы. Всё на русском, всё локально.

И вот что из этого уже выходит 👇

📚 Факты модель не выдумывает — достаёт из памяти дословно:

▎ — Что такое Россия?
▎ — Россия — многонациональное государство с широким этнокультурным многообразием.
▎ — Что такое Слоны?
▎ — Слоны — самые крупные наземные животные на Земле.
▎ — Что такое Рунет?
▎ — Рунет — русскоязычная часть Интернета.

Это не «нагенерила похоже на правду». Это достала ровно то, что туда положили. Галлюцинаций на фактах — нет by design.


🪄 Самое сочное — авто-память. Говорю модели новый факт прямо в разговоре, без дообучения и перезапуска:
▎ — Запомни: Зурбаган — портовый город из книг Грина.
▎ — Запомнил.
▎ — Что такое Зурбаган?
▎ — Зурбаган — портовый город из книг Грина.
Сказал — запомнила — выдала обратно. Дословно. Среди десятков тысяч других фактов нашла именно этот. 🎯

Только это не часть KV кэша, который растёт как уровень углекислого газа в тесной бане...а часть постоянной памяти. потому что разговор вмешивается в общую память и разные её части помнят то, что нужно. (тут тоже была отдельная история)


💬 С разговором сложнее, и врать не буду. Болтовню сейчас полирую через RLAIF/DPO — другой сильный ИИ пишет эталонные ответы, а моя модель тянется к ним. Это первый заход DPO, всего на 500 примерах, местами ещё колбасит. Но проблески — настоящие:

▎ — Мне одиноко.
▎ — Я тут. Если хочешь — могу просто помолчать. Помолчать рядом.

▎ — Как начать бегать по утрам?
▎ — Бег — отличный способ снять стресс. А после работы?

▎ — Спасибо за помощь!
▎ — Если захочешь поговорить — я здесь. Береги себя.


Для модели на CPU, которая отвечает со скоростью 20 токенов в секунду = неплохо. А то, что всю фактологию держит в собственной памяти = возбуждает.

🛠 Что дальше: докатывается большой сбор пар (~3000) и второй, серьёзный заход DPO. После — прогон по открытым русским бенчмаркам 2025, без поблажек, с честным разбором где криво.

Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥5215👍6👏5🕊1
так так так..
🤔123
А что если взять MLP...обучить на MNIST до эталона...а потом каждый слой аккуратно вскрыть и найти мат закономерность и "вытянуть" её. Хммммммм. У меня идея, которая сломала вчера мне мозг, но сегодня уже отработала...ожидайте.
🔥19🤔6🕊2👨‍💻1
Техножнец
А что если взять MLP...обучить на MNIST до эталона...а потом каждый слой аккуратно вскрыть и найти мат закономерность и "вытянуть" её. Хммммммм. У меня идея, которая сломала вчера мне мозг, но сегодня уже отработала...ожидайте.
Как...получается...раскрыть чёрный ящик в стеклянный полностью. закрыть этот странный вопрос непонятного обучения, там и backprop не нужен...backward как таковой уже не так работает...ёмаё
🤔144🕊2🆒1
Техножнец
Как...получается...раскрыть чёрный ящик в стеклянный полностью. закрыть этот странный вопрос непонятного обучения, там и backprop не нужен...backward как таковой уже не так работает...ёмаё
Дело в том, что я уже бОльшую часть сделал...поговорить есть о чём. Причём...бумага уже примерно таковая есть на 2025 год. Но я не уверен, что стоит пока что о ней вести речь. Релевантность остаётся в степени интерпретируемости в схожую область. Оно со стороны кажется, что так...а вот нюансы распадаются на не то, что форки...а на другие вселенные. Каждая из которых гнёт свою линию.

Впрочем...там тоже неплохие успехи. «Lagrange Regressor (LReg)»
👍11🤔432🔥2😱1🕊1🤣11
SETUN II* — троичный AI-процессор, который уже считает на "кремнии*"

Что это вообще


*Название будет сменяться, наследию деваться некуда

Гибрид «CPU + AI-ускоритель» на балансной троичной арифметике. Веса нейросети хранятся не как длинные цепочки из 0 и 1, а как три состояния: −1, 0, +1.

И тут вся соль. Умножение на таком весе вырождается:
× (−1) → вычесть
× 0 → пропустить (а это ~31% всех весов!)
× (+1) → прибавить


Полноценный умножитель не нужен вообще — остаётся только сложение, вычитание или пропуск. А множитель — самая дорогая часть MAC-блока, почти половина его площади (47% площади вычислительной полосы в нашем синтезе). Мы меняем его на «знак + сумматор». Плюс каждый третий вес — ноль, его можно не считать вовсе. Даровая экономия энергии на каждой операции.

"Потомок" советской «Сетуни» (МГУ, 1958) — первого в мире серийного троичного компьютера. Только теперь сегодня на вдохновении это AI-ускоритель, и синтезируется он на стандартных CMOS-ячейках. Цель — Микрон 180 нм. Узел, который Россия контролирует уже сейчас.

Главное: ядро РАБОТАЕТ на FPGA

Не симуляция. Не картинка. Процессор (управляющее ядро + троичная ткань + демон) исполнил программу на живом FPGAGW5AST-138, Tang Mega 138K. Всё прочитано по JTAG, цифры считаны прямо с кремния:

базовый matmul на кремнии — C=[[7,10],[19,22]], сошлось бит-в-бит
1091 такт матмула, точно совпало с gate-симуляцией
демон принял 86% выходов на РЕАЛЬНОМ слое nanoGPT


Самый рискованный шаг — заставить кремний считать троичную математику — уже пройден.

Троичный GPT реально пишет текст
Наш nanoGPT: 4.9 млн параметров, 97% весов троичные, обучен на Шекспире. Генерирует связный текст — с именами персонажей, репликами, пунктуацией. Все его матмулы — это ровно операция нашей ткани (add/sub/skip).

И вот что важно — троичная модель обобщает лучше полноточной:
ТроичныйGPT  4.9M   val loss 1.55   1.49 МБ
fp-бейзлайн 10.8M val loss 1.77 21.6 МБ

Вдвое меньше параметров, в 14 раз меньше памяти — и качество выше. Упрощение до −1/0/+1 работает как встроенная регуляризация: модель хуже «зубрит» и лучше работает на новом.

Демон — спекулятивное умножение

Аппаратный механизм, который предсказывает результат и проверяет догадку «забором» (fence) с гарантией: итоговая ошибка всегда ≤ порога ε. Угадал — пропустили пересчёт. Не угадал — посчитали честно. Скорость без потери точности.
На реальных весах: ε 5% → принято 47% (×1.9) ε 10% → принято 76% (×4.0) ε 20% → принято 95% (×16)

MNIST на нашем RTL-движке


Самую изученную сеть в мире обучили в троичном виде и прогнали потактово на нашем железе:

97.3% точности (fp-бейзлайн 98.0% — разрыв всего 0.7%)
8/8 тест-цифр классифицировано верно
16× меньше памяти весов: 49.6 КБ против 794 КБ

Энергия — где троичность рвёт всех

Энергия на одну операцию (MAC):
CPU AMD Zen fp32 — 650–1250 пДж
Наша ткань @180нм — 25–55 пДж
A100 bf16 @7нм — 3.1 пДж
Наша ткань на изо-узле 7нм — ~0.3 пДж

Уже на 200-180-нм заводе мы экономичнее серверного CPU в разы. Перенеси тот же дизайн на 7 нм — и по энергии на операцию обгоняем A100 примерно в 10 раз. (влажные цифровые мечты - прим. ред.) Выигрыш чисто архитектурный (нет умножителя + 2-битные операнды), он переезжает вместе с техпроцессом.

Архитектура — растёт как LEGO

Кристалл собран из одинаковых тайлов (как у Tenstorrent). Нужно мощнее — добавляешь тайлы, ничего не переписывая. При росте сетки в 4 раза частота держится 77→70 МГц — почти не падает. Один дизайн масштабируется от датчика в часах до стойки в дата-центре.

Где мы сейчас
Самое страшное позади: кремний считает троичную математику, демон ускоряет, модель пишет текст. Дальше — сообщу.


Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥101118😁2🕊2🤔1🤯1
Доброе утро
🤝274🦄2🔥1
Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥21👍322🤔2🤯1
Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥14322🤣1
Поддержать канал:

🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13722🤣1
🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1262🕊1
🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥14421🕊1🤣1
🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1942🕊1🤣1👨‍💻1
Пока что всё.


🦆🦆🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал: PAYPAL [email protected]
Поддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqT
Поддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3642🕊1
Заброшенный (необитаемый) муравейник, с характерным конусом над землёй, если залить жидким свинцом и дать время охладиться, а потом аккуратно извлечь, то мы получим интересный узор.

Ну...в MLP слое также...надо только выловить закономерности ;)
🤔144👾32👍1🕊1🤣1😈1
А ведь если присмотреться...
😁10🤝4🕊3🤣2