Neural Kovalskii

LLaDA - это диффузионная языковая модель (LLM) что?

Появился новый тип LLM на основе диффузионных моделей

Отличие от авторегрессии(текущие LLM) в том, что в таких моделях каждый токен предсказывается последовательно, а в диффузионном подходе предсказывается целая матрица токенов в заданном фрейме

Это похоже на то, как идёт генерация изображений 100×100 пикселей из шума в понятную картинку

В этом подходе модель генерирует не последовательность, а целый текстовый фрейм. Нужны сравнения по весу, стоимости обучения и инференса - подход выглядит новаторским. На мой взгляд, это несколько усложняет процесс инференса и сборки датасета, но нужно тестировать! Посмотрим, что там по open-source.

Основные отличия вот в чем
Авторегрессивные модели (большинство существующих LLM):
Генерируют текст последовательно, токен за токеном слева направо
Каждый новый токен зависит от предыдущих токенов
Более прямолинейный процесс генерации

Диффузионные модели (LLaDA, Mercury):
Генерируют все токены одновременно, постепенно "очищая" шум
Работают по принципу "от грубого к точному" (coarse-to-fine)
Могут позволить более гибкое управление текстом (например, задание определенных слов в конкретных позициях)

До сих пор диффузионные модели доминировали в генерации изображений и видео, в то время как текст опирался на авторегрессию
Mercury от Inception Labs представлена как первая коммерческая диффузионная LLM

Судя по посту Karpathy, такой подход может привести к появлению моделей с уникальными сильными и слабыми сторонами

Потенциальные преимущества диффузионных LLM могут включать параллельную генерацию (возможно, более быстрый инференс) и более гибкое управление содержимым ждем open-source и гоу тестить!

1🔥19👍6❤5

2.06K views12:57

Neural Kovalskii

VLM заменит OCR?

Ты знал что qwen 2.5 VL вернет тебе bbox?

А теперь магия без рук!

Я взял этот квен Qwen2.5-VL-72B-Instruct-FP8-Dynamic

Взял на иммерс эту тачку https://immers.cloud/flavor/view/?id=984 (Цена, месяц = 269 660,16 ₽)

Наконец дождался пока vLLM обновится и станет поддерживать 2.5 VL

Взял вот такой код

OBJECT_JSON_SCHEMA = {
    "type": "object",
    "properties": {
        "objects": {
            "type": "array",
            "items": {
                "type": "object",
                "properties": {
                    "bbox_2d": {
                        "type": "array",
                        "description": "Coordinates of the table bounding box [x1, y1, x2, y2]",
                        "items": {
                            "type": "integer"
                        }
                    },
                    "label": {
                        "type": "string",
                        "description": "Object label, e.g. 'table'"
                    }
                },
                "required": ["bbox_2d", "label"]
            }
        }
    },
    "required": ["objects"]
}

Получил вот такой ответ

{
  "id": "chatcmpl-9a5edf7433e246b78376c4f18bdbf263",
  "object": "chat.completion",
  "created": 1741078401,
  "model": "qwen2.5-vl-72b-instruct",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "assistant",
        "reasoning_content": null,
        "content": "{\"objects\": [{\"bbox_2d\": [54, 126, 532, 434], \"label\": \"table\"}]}",
        "tool_calls": []
      },
      "logprobs": null,
      "finish_reason": "stop",
      "stop_reason": null
    }
  ],
  "usage": {
    "prompt_tokens": 724,
    "total_tokens": 760,
    "completion_tokens": 36,
    "prompt_tokens_details": null
  },
  "prompt_logprobs": null
}

Но это только начало просто вернуть bbox таблицы это легко

По мимо этого мы можем получить содержимое, но ведь есть кейсы сложнее

А что если прислать сообщения из тг например?
Определить sender'ов и сразу в один проход достать текст?

  "objects": [
    {
      "bbox_2d": [
        58,
        292,
        540,
        360
      ],
      "label": "Кстати вы знали что Qwen 2.5 VL может выдавать bbox объектов? https://qwenlm.github.io/blog/qwen2.5-vl/",
      "sender": "user1",
      "type": "text"
    },
    {
      "bbox_2d": [
        60,
        374,
        276,
        404
      ],
      "label": "о спасибо попробую",
      "sender": "user2",
      "type": "text"
    },
    {
      "bbox_2d": [
        60,
        413,
        490,
        466
      ],
      "label": "00:19, 72.9 KB",
      "sender": "user2",
      "type": "voice"
    }

Да на х4 4090 это около 35 секунд, но!
Сам текст она достала нем немного ужасно, но с этим уже можно работать!

Я вас направил! Дальше я думаю вы знаете как использовать это в бизнесе и стартапах!

👍18🔥6❤5

2.48K views09:38

Neural Kovalskii

Forwarded from AI для Всех (Artemii)

0:15

This media is not supported in your browser

VIEW IN TELEGRAM

Кажется это не CGI

🔥10😁4

1.72K views17:47

Neural Kovalskii

Снова ваш карманный AI-эксперт летал в Москву и вместе с командой @red_mad_robot рассказывал и обучал.

Речь как всегда, шла вокруг LLM и GenAI

Как вывод: сейчас всё меняется очень быстро

Полгода назад мы рассказывали про Naive RAG, а сегодня про MAS, MCP Deep Research и LLaDa

Что ж, попрактиковался с микрофоном, были очень интересные вопросы!

🔥3411❤6

2.19K views14:38

Neural Kovalskii

Neural Kovalskii pinned «Мои пет-проекты в AI: от идеи до 9000 MAU за год Я тут по-тихому разрабатываю через Claude инструменты, которыми пользуюсь каждый день сам, и по недавней выгрузке имею ~9 000 активных пользователей в месяц Некоторым проектам меньше месяца, некоторым больше…»

17:47

Neural Kovalskii

0:10

This media is not supported in your browser

VIEW IN TELEGRAM

С 8 марта, вас ожидает чело́век павук

😁24🔥138❤5

2.07K views08:12

Neural Kovalskii

Провожу исследование разных подходов retrieval (лучшего поиска информации на основе датасета RAG челенджа и спасибо @IlyaRice (1 место) в предоставленных данных

Задача проверялась простая найти самый релевантный контекст(страницу) из 13 тысяч для ответа LLM на вопросы финансовых отчетов

Перед запуском использовался простой query expansion с парой few-shot примеров
few-shots генерировались на основе вычитки в документы где точно знаем ответ (подбор релевантности)

Exemple:
1) Original query: Did Downer EDI Limited announce a share buyback plan in the annual report? If there is no mention, return False.
Expansions query: Share buyback plan

2) Original query: According to the annual report, what is the Cash flow from operations (in USD) for Wheeler Real Estate Investment Trust, Inc. (within the last period or at the end of the last period)? If data is not available, return 'N/A'.
Expansions query: Cash flow from operations (in USD) last period or at the end of the last period

3) Original query: For Aurora Innovation, Inc., what was the value of Number of patents at year-end at the end of the period listed in annual report? If data is not available, return 'N/A'.
Expansions query: Total count of patents over company owned

(В E5 и bge-m3 не использовалось более одного примера в логах — переделаю)

Кейс запуска!

E-5 (без реранкера)
bge-m3 (без реранкера)
OpenAI Small (без реранкера)

Скоро запущу прогоны с кросс-энкодером!
Также создам коллекцию с крупными моделями векторизации.

Average Pairwise Match Scores (с лучшим результатом Ильи:

Ope-ily: 66.00%
Ope-E5-: 28.00%
Ope-BGE: 17.00%
ily-E5-: 31.00%
ily-BGE: 20.00%
E5--BGE: 14.00%

Matches with ilyaRice o3 (Base Model):

OpenAI Small (No Reranker): 66.00%
E5-large: 31.00%
BGE-M3: 20.00%

🔥21❤7👍3

1.95K viewsedited 11:13

Neural Kovalskii

Forwarded from LLM под капотом

Можно запускать новые Enterprise RAG эксперименты!

49 человек попросило запустить заново Enterprise RAG Challenge Submission API, чтобы можно было поставить еще несколько экспериментов.

Он запущен по новому адресу - https://rag.abdullin.com

Можете отправлять свои новые эксперименты туда. Только, пожалуйста, не забывайте заполнять форму с протоколом эксперимента. Так мы сможем потом подвести итоги и проанализировать.

Самый интересный сейчас момент - это полностью локальные системы, у которых локально работает все - parsing/OCR, embeddings (если они есть) и LLM. В Leaderboards у нас пока помечены как локальные системы только те архитектуры, в которых LLM локальный. Я потом постараюсь добавить колонку для Fully Local.

Если верить цифрам R-Score/G-Score, узкое место полностью локальных систем - это retrieval. Если в облаке openai large embeddings творят чудеса, то с локальными системами еще предстоит разобраться.

Тут дополнительно варианты разные варианты retrieval в Enterprise RAG Challenge уже изучали Valerii и Илья (см https://t.iss.one/neuraldeep/1348 в NeuralDeep).

Мне кажется перспективным направлением решение Dmitry Buykin. Оно работает в облаке, но вместо embeddings использует онтологии с SO/CoT чеклистами. Теоретически тут “R Score” может упасть не так сильно при переносе на локальные модели.

Ваш, @llm_under_hood 🤗

PS: Если останется интерес, то можно попробовать через пару месяцев прогнать новый раунд ERC. С тем же генератором вопросов, но с новыми файлами.

👍19❤5

1.39K views11:32

Neural Kovalskii

Продолжаю эксперименты по документам из RAG Challenge
Задела эта тема так как это финансовые документы и наконец есть результаты (правильные ответы)

Собрал стенд с разными векторными моделями и подходами поиска и составить для себя лучший автоматический пайплайн поиска и ответа

На скрине оценка качества retrieval, сравнение моих двух подходов на базе векторов openai (small/large) моделей + query expansion CoT)

+ Я почти правильно собрал метрики подсчёта оценки так как почти такие же метрики у Ильи (первое место)

В комментариях приложу md файл + html для вашей оценки

P.S Забыл самое важное
small openai для векторов подойдет когда вы хотите с экономить но если вам важны очень хороший ретривал и высокая разница в score то в финансовом секторе пока ничего лучше large от openai нет)

❤13🔥84

1.7K viewsedited 14:55

Neural Kovalskii

Forwarded from red_mad_robot

AI_tools_2025_red_mad_robot.pdf

7.7 MB

↗️

Подборка AI-сервисов, чтобы сделать бизнес-процессы эффективнее

Рынок перенасыщен AI-решениями, но далеко не все из них дают бизнесу измеримую пользу. Важно понимать, какие инструменты оптимизируют процессы, снижают затраты и повышают эффективность.

Команда red_mad_robot AI собрала подборку рабочих сервисов — сохраняйте, делитесь и дополняйте список в комментариях.

P.S. Это первая часть подборки — в ней собраны только международные инструменты. В следующем выпуске разберём российские решения.

#AI_moment

Please open Telegram to view this post

VIEW IN TELEGRAM

👍19👎22🤨1

1.28K views12:38

Neural Kovalskii

Forwarded from Лёха ведет дневник

Периодически буду делиться тем, чем занимаемся на работе и какие продукты и полезные штуки делаем

Знакомьтесь — @daisytranscribe_bot

⚡

Это бесплатный ТГ-бот транскрибатор (переводит аудио в текст) и у него есть несколько приятных особенностей:

1⃣Поддержка файлов длительностью до 160 минут

2⃣Максимальный размер файла — 2 GB! (покажите мне хоть одного такого бота)

3⃣Поддержка нескольких языков

4⃣Разделение спикеров по ролям

5⃣Возможность задать кастомный промпт для работы с распознанным текстом

На текущий момент бот обработал более 55 тыс. файлов суммарной длительностью более 12 тыс. часов.

Пользуйтесь на здоровье 🩵

@alexs_journal

Please open Telegram to view this post

VIEW IN TELEGRAM

4🔥19

1.45K views18:17

Neural Kovalskii

Deep Research Showdown теперь на Хабре

Йоу, народ 👋
Переписал свои изыскания про Deep Research на Хабр. Если вам интересно, как я мучил LLM-ки, сравнивал OpenAI, Grok, Perplexity и свой NDT на Tavily, то залетайте, читайте и поднимайте мне карму! 🙏

Это моя первая статья на Хабре, буду рад вашим комментариям 🩶

Please open Telegram to view this post

VIEW IN TELEGRAM

Хабр

Deep Research Showdown: битва AI-систем за качество исследований

Как я сравнил топовые AI-модели для глубокого анализа данных и собственную разработку Привет! Меня зовут Валера Ковальский, я CEO NDT by red_mad_robot. Недавно я протестировал ведущие AI-системы,...

2🔥27👍103

1.92K views19:00

Neural Kovalskii

Forwarded from Korenev AI - GPT в тапочках🩴

➡️

Обучение LLM для бизнеса: практическое руководство с примерами и советами

Ловите новый вкусный видос!❤️

Там мы разбираем, как научить LLM новым навыкам, начиная с простых методов и заканчивая продвинутыми техниками. Парни делятся реальным опытом! Одна только история про автоматическое формирование отчетов с LLM только чего стоит!

В пасхалке – разбор проблем извлечения информации из сложных PDF-документов и таблиц.

В видео даются практические советы по подготовке данных, выбору методов обучения, оценке результатов и стоимости всего этого банкета.

Забивайте на все дела, отменяйте все поездки и походы по гостям, срочно смотреть!

Ютуб
Рутуб

➡️Подпишись на Korenev_AI

👈

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥18👍54

1.49K views11:15

Neural Kovalskii

Forwarded from Daisy news

🆕

Генерация изображений и новые AI-модели

Теперь в Daisy Web можно создавать изображения. Выбери «Генерация изображений» в списке моделей, опиши задумку — и получи результат. Чтобы картинка получилась качественнее, модель автоматически доработает и улучшит твой запрос.

⚠️ Функция в тестовом режиме — при высокой нагрузке возможны перебои, но команда уже работает над оптимизацией.

А ещё добавили новые AI-модели:

🔥 Claude 3.7 — лучшая нейросеть для написания кода;
🔥 Gemini 2.0 — теперь ещё эффективнее справляется с запросами.

Пробуй и делись впечатлениями в комментариях.

⚡️ Daisy Web — удобная веб-версия бота с возможностью анализа изображений и документов
🌼 @daisygpt_bot

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥13👍4

1.57K views14:22

Neural Kovalskii

Forwarded from BOGDANISSSIMO

Пересесть с классической IDE на Cursor - как пересесть с лошади на автомобиль. Риск ДТП выше, если ты невнимателен и медленно обучаемый, но это не значит что до того как садиться на машину нужно для тренировки дальше для тренировки кататься на лошади. В конечном итоге бенефиты ускорения работы х10 переплёвывают все минусы

👍24🤨3

1.3K views09:28

About

Blog

Apps

Platform