This media is not supported in your browser
VIEW IN TELEGRAM
Ты в конце недели...ставь лайк если правда.
1👍24👻3🕊1
Честные отчёты. Такого не увидите на каналах других:
Субстрат внимания 16 - обосрался в битве с обычным BM25 почти по всем параметрам включая скорость и качество поиска.
Какая была бы реакция у человека, который бы несколько месяцев тянул свою идею, уже был готов объявить, что субстрат это ультра гига мощь и обхезался...расстроился? обиделся на мир и выкинул всё?
Объясняю:
Мне почему наука нравится? Потому что если что-то не получается, то это не метод неправильный...всё так-то или иначе правильное...это ты дебил и ты являешься слабым звеном в этой системе. Значит твоё ведро всё ещё резонирует пустотой в ответ на вопрос: "Почему так случилось то?"
Облегчение? КОНЕЧНО! Значит мне просто надо подтянуть знания и лучше изучить то, что я уже сделал. Надежда исчезла? НЕТ, НИ В КОЕМ СЛУЧАЕ! Надежда засветилась потому что выстоять своим новым методом в принципе на ногах и быть во столько то раз хуже и во столько то раз не эффективные это же прямая выкладка...прямо путь по карте куда и как двигаться и в каком разрезе рассматривать проблему.
Поэтому первым делом я буду делать оптимизации и улушчения. И это....РАДОСТНАЯ НОВОСТЬ!
Потому что теперь есть чёткий план - "Что делать дальше?" , вместо..."Ну вот доделал, а что теперь?"
Значит, что всё продолжается и субстрат ещё не вызрел.
Примерно такое отношение у меня к ситуациям с "провалами"...я , если честно, в провалы не верю...я верю в просчёты.
🦆 🦆 🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:[email protected]
Поддержать канал: USDT(trc20)
Поддержать канал: BITCOIN
Субстрат внимания 16 - обосрался в битве с обычным BM25 почти по всем параметрам включая скорость и качество поиска.
Какая была бы реакция у человека, который бы несколько месяцев тянул свою идею, уже был готов объявить, что субстрат это ультра гига мощь и обхезался...расстроился? обиделся на мир и выкинул всё?
Объясняю:
Мне почему наука нравится? Потому что если что-то не получается, то это не метод неправильный...всё так-то или иначе правильное...это ты дебил и ты являешься слабым звеном в этой системе. Значит твоё ведро всё ещё резонирует пустотой в ответ на вопрос: "Почему так случилось то?"
Облегчение? КОНЕЧНО! Значит мне просто надо подтянуть знания и лучше изучить то, что я уже сделал. Надежда исчезла? НЕТ, НИ В КОЕМ СЛУЧАЕ! Надежда засветилась потому что выстоять своим новым методом в принципе на ногах и быть во столько то раз хуже и во столько то раз не эффективные это же прямая выкладка...прямо путь по карте куда и как двигаться и в каком разрезе рассматривать проблему.
Поэтому первым делом я буду делать оптимизации и улушчения. И это....РАДОСТНАЯ НОВОСТЬ!
Потому что теперь есть чёткий план - "Что делать дальше?" , вместо..."Ну вот доделал, а что теперь?"
Значит, что всё продолжается и субстрат ещё не вызрел.
Примерно такое отношение у меня к ситуациям с "провалами"...я , если честно, в провалы не верю...я верю в просчёты.
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
👍31🔥12👏2❤1🕊1🤗1
Подтверждая сказанное цифрами, которые в другом случае раскололи бы сознание. (смотрите ещё и по качеству просадка) Но, тут всё просто - нужно дальше работать!
Думаю спекулятивки сюда накину и обойду на повороте.
ВКЛЮЧАЮ ДЕМОНА!
🦆 🦆 🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:[email protected]
Поддержать канал: USDT(trc20)
Поддержать канал: BITCOIN
Думаю спекулятивки сюда накину и обойду на повороте.
ВКЛЮЧАЮ ДЕМОНА!
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🙏12👍5🕊1
А помните вы мне писали и переживали , что log16 тоже "украли" китайцы. Есть такая поговорка: "Врагу не пожелаешь"
💯14🔥6👏2🕊2
Нейроны объединённые в сетки готовы:
1 группа - решает полностью арифметику и является научным калькулятором.
2 группа - решает физику (подробности позже), работает в команде с арифметической группой.
3 группы - решает химию (почти, подробности позже).
И, вероятно, будет 4 группа, которая будет рулить между ними, либо хитрый механизм - это надо смотреть.
1 группа - решает полностью арифметику и является научным калькулятором.
2 группа - решает физику (подробности позже), работает в команде с арифметической группой.
3 группы - решает химию (почти, подробности позже).
И, вероятно, будет 4 группа, которая будет рулить между ними, либо хитрый механизм - это надо смотреть.
🔥10🕊4👀4👍2🦄1 1
Техножнец
Подтверждая сказанное цифрами, которые в другом случае раскололи бы сознание. (смотрите ещё и по качеству просадка) Но, тут всё просто - нужно дальше работать! Думаю спекулятивки сюда накину и обойду на повороте. ВКЛЮЧАЮ ДЕМОНА! 🦆 🦆 🦆 Поддержать канал: ТБАНК…
Помогло! И не только это. Починил пару косяков. Уже обгоняем BM25...
🔥21❤3🦄3🕊2
Т.к. Rukallama маленькая моделька, то ей многие навыки нужно узнать не из огромных количеств токенов, а благодаря правильному обучению. Сейчас идёт интересная стадия Grounding SFT - когда ей подаются факты с эмуляцией процесса RAG и она учится учитывать эту информацию в ответе. + дополнительный Grounding NEURONS SFT - чтобы нейросборки Поповича смогли участвовать на том же уровне, что и RAG в выборе что ответить модельке.
👍21🔥7🕊2🦄2
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9🕊1
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9🕊1
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9🕊1
Forwarded from Техножнец
Синтеты. Запрашиваю транш вашей мощности для поддержания проектов. Закончились топливные баки в
GOOGLE COLAB - не получается больше подтверждать гипотезы (А100 постоянно занята Rukallama)Закончились API для генерации датасетов - не получается расширить возможности
Нужно продолжать и не нужно тормозить вообще. Ниже ссылки, вместе справимся:
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🫡8👌2🕊2
Техножнец
Синтеты. Запрашиваю транш вашей мощности для поддержания проектов. Закончились топливные баки в GOOGLE COLAB - не получается больше подтверждать гипотезы (А100 постоянно занята Rukallama) Закончились API для генерации датасетов - не получается расширить…
Синтеты, что закинули вы ранее, я уже пустил на мельницу и закупил DeepSeek, OpenRouter, Gemini оплату отложил и Google Colab оплатил. Когда поддерживаете, я просто смело дальше исследую все варианты.
👍14🕊2🦄2
Вышел в курилку из цехов с опусом 4.8, обсудить опус 4.8...
Хорошо, что хоть пар есть куда сбросить...
*оба горько затянули сигарету
🦆 🦆 🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:[email protected]
Поддержать канал: USDT(trc20)
Поддержать канал: BITCOIN
Хорошо, что хоть пар есть куда сбросить...
*оба горько затянули сигарету
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩12❤1🤔1🕊1
🔬 СУБСТРАТ: Заставил модель быть честной и обыграл классику
Это не история «сделали и сразу заработало». Я дрался за каждый
⚙️ С чего начал. Взял живую модель -
🥊 С кем сравнивал. Не с воздухом. Поставил рядом двух честных соперников - классические способы дать модели память:потом выкинул e5...он ппц долгий если его не переписывать и не векторизировать дополнительно в плане операций )
😣 Где было больно. Сначала субстрат проиграл. На многошаговых вопросах - где надо связать два факта - он сел в лужу: терялся, отвечал не тем, отставал от простого
💡 Пробовал и красивую идею - «
⚡️ Потом был бой за скорость. Мало быть точным - нельзя быть медленным. Я вскрыл, где утекает время, и переписал поиск так, что он стал больше чем в
🏆 Чем кончилось. На честном свежем поле субстрат выиграл сразу по всем фронтам: точнее
🎯 Вывод. Обычное векторное хранилище ищет похожее и позволяет модели додумывать.
🦆 🦆 🦆
Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:[email protected]
Поддержать канал: USDT(trc20)
Поддержать канал: BITCOIN
bm25, e5Это не история «сделали и сразу заработало». Я дрался за каждый
шаг.⚙️ С чего начал. Взял живую модель -
Qwen3-4B - и проверил её саму, без памяти. На свежих русских вопросах, которых она раньше не видела, она попадала в цель в считанные проценты случаев, а в остальном уверенно выдумывала: не тех людей, не те даты, не те города. Так ведут себя все генеративные модели - обязаны ответить, даже когда сказать нечего.🥊 С кем сравнивал. Не с воздухом. Поставил рядом двух честных соперников - классические способы дать модели память:
BM25 (проверенный лексический поиск) и e5 (современное «векторное хранилище», на котором сегодня строят почти все RAG-системы). И гонял всех в одинаковых условиях: незнакомые вопросы, в том числе данные 2025 года, которых субстрат в глаза не видел; поиск нужного факта среди тысяч отвлекающих; вопросы в несколько шагов. (😣 Где было больно. Сначала субстрат проиграл. На многошаговых вопросах - где надо связать два факта - он сел в лужу: терялся, отвечал не тем, отставал от простого
BM25. Честно признал и пошёл искать причину. Оказалось - я спрашивал его неправильно. Перестроил подход: разбил сложный вопрос на шаги, научил вытягивать мост между фактами - и результат подскочил, обогнав классику.💡 Пробовал и красивую идею - «
спекулятивные вычисления», чтобы ускорить всё хитрым предсказанием. Проверил не очень честно и не так: Написал, что сработало на канале. Проверил честно и держа лупу в руках: на моей задаче она ускорения не дала. Не стал врать себе, отбросил и пошёл другим путём.⚡️ Потом был бой за скорость. Мало быть точным - нельзя быть медленным. Я вскрыл, где утекает время, и переписал поиск так, что он стал больше чем в
десять раз быстрее прежнего - и в итоге обогнал даже BM25, который славится скоростью.🏆 Чем кончилось. На честном свежем поле субстрат выиграл сразу по всем фронтам: точнее
BM25 и, главное, честнее. Голая модель на тех же вопросах врала почти всегда; модель с субстратом отвечает верно в большинстве случаев, а когда факта нет - говорит «не знаю», а не сочиняет. Галлюцинации не «уменьшились» - они исчезли как класс. ( с оговоркой, что вы в субстрат нормальную базу знаний впихнули )🎯 Вывод. Обычное векторное хранилище ищет похожее и позволяет модели додумывать.
Субстрат отдаёт именно то, что есть, и держит модель в рамках: знаю - отвечаю, не знаю - молчу. Я не принял ни одного результата на веру - проверял руками каждый ответ, признавал поражения и переигрывал. Поэтому за словом «обыграл» стоят не лозунги, а измеренный бой: против настоящих соперников, на незнакомых данных.Поддержать канал: ТБАНК
Поддержать канал: ЮМАНИ
Поддержать канал:
PAYPAL Поддержать канал: USDT(trc20)
TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥28❤13👍10👏6🕊2
Техножнец
🔬 СУБСТРАТ: Заставил модель быть честной и обыграл классику bm25, e5 Это не история «сделали и сразу заработало». Я дрался за каждый шаг. ⚙️ С чего начал. Взял живую модель - Qwen3-4B - и проверил её саму, без памяти. На свежих русских вопросах, которых…
Этому проекту почти 1 год...он ещё тянется со времён TLM KAN ...там я тоже сильно занят был вопросом сжатия х16
❤11👍6🔥4🕊2😱1
Техножнец
Grounding-SFT, в общем, забыл вкрутить 😃 EOS. Щас, благо , вовремя проставил.
Всё нормально - модель достаёт из субстрата то, что нужно, но дальше не могла остановиться (снова потеряла возможность вовремя себя осадить). Вот, как раз-таки, токен EOS поможет нормально делать вещи: отвечать на вопросы, вытаскивать факты...ну и вовремя останавливаться. А то совсем всё очень плохо в этом плане стало после 500 шагов, хоть вовремя обнаружил это дело.
Самое главное в такие моменты не смотреть на метрики, а больше полагаться на генерации и тестирование самого контента, который производит твоя LLM. Иногда бывает такое, что LOSS и PPL (перплексия) показывают норм, а генерация мусор. Реже наоборот.
В любом случае есть ориентиры и понимание.
Кстати, субстрат расширяет контекст
Потому что субстрат в обязательном порядке держит в памяти контекст. Это можно установить в виде константы. Например: Ставишь 100к токенов обязательной памятью и модель в 100% случаев будет помнить этот контекст, даже если её ей не позволяет его "видеть". Далее механизм работает интересно - память медленно по значимости перемещается в более сгруппированное состояние токенов в следующий блок средней памяти и там потом когда-нибудь дойдёт до блока самой медленной постоянной памяти.
Всё нормально - модель достаёт из субстрата то, что нужно, но дальше не могла остановиться (снова потеряла возможность вовремя себя осадить). Вот, как раз-таки, токен EOS поможет нормально делать вещи: отвечать на вопросы, вытаскивать факты...ну и вовремя останавливаться. А то совсем всё очень плохо в этом плане стало после 500 шагов, хоть вовремя обнаружил это дело.
Самое главное в такие моменты не смотреть на метрики, а больше полагаться на генерации и тестирование самого контента, который производит твоя LLM. Иногда бывает такое, что LOSS и PPL (перплексия) показывают норм, а генерация мусор. Реже наоборот.
В любом случае есть ориентиры и понимание.
Кстати, субстрат расширяет контекст
Rukallama не бесплатно, но стоимостью субстрата (на его инференс на RAM уходит чутка, но не так много как у KV-cache...воообще не так). Потому что субстрат в обязательном порядке держит в памяти контекст. Это можно установить в виде константы. Например: Ставишь 100к токенов обязательной памятью и модель в 100% случаев будет помнить этот контекст, даже если её ей не позволяет его "видеть". Далее механизм работает интересно - память медленно по значимости перемещается в более сгруппированное состояние токенов в следующий блок средней памяти и там потом когда-нибудь дойдёт до блока самой медленной постоянной памяти.
В итоге - работает чётко. НО БУДУТ СВОИ НАЛОМЫ, КОНЕЧНО! Так всегда было и будет...баги👍15❤5🕊3🤝1
Техножнец
🔬 СУБСТРАТ: Заставил модель быть честной и обыграл классику bm25, e5 Это не история «сделали и сразу заработало». Я дрался за каждый шаг. ⚙️ С чего начал. Взял живую модель - Qwen3-4B - и проверил её саму, без памяти. На свежих русских вопросах, которых…
Ещё кое что прикрутил...иду спать. Увлекательные дни и ночи пошли. Спасибо за донаты - очень помогает делу!
❤14🕊2👍1