Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

🔥https://vasilisa.sibnn.ai/ - большие языковые модели у вас на устройстве.
Без СМС, регистрации и Интернета!
Пока что альфа-версия. Будем рады обратной связи.

🔥8❤4😁3

564 viewsedited 11:48

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Вика Кондрашук

Сегодня загрузила книгу "Кристалл роста к Русскому экономическому чуду" в нашу в Василису. Размер книги 368 страниц. Скорость векторизации, как и работы моделей зависит от вашего устройства.
Это один из лучших учебников по экономике эпохи правления И.В. Сталина. И задала вопрос: "В чем национальная идея России?".
Василиса отдает ответ в режиме цитирования - находит наиболее релевантный фрагмент текста и выполняет саммаризацию нашей LLM. В результате мы получаем однозначный ответ: "В воспитании поколений".

Ссылку на книгу прикрепляю:
🇷🇺Книга А.С.Галушки, А.К.Ниязметова, М.О.Окулова «КРИСТАЛЛ РОСТА. К русскому экономическому чуду» доступна для бесплатного скачивания https://t.iss.one/crystal_book/455

🔥2❤1😁1💯1

439 views14:56

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

🔥https://vasilisa.sibnn.ai/ - большие языковые модели у вас на устройстве. Без СМС, регистрации и Интернета! Пока что альфа-версия. Будем рады обратной связи.

В основе решения "Василиса" лежит наша авторская модель "Менон" на 1.5B
https://huggingface.co/bond005/meno-tiny-0.1
На MERA (для русского языка) модель "Менон" - лучший среди малых моделей "for edge devices" в своем размерном классе.

Название модели "Менон" - это отсылка к одному из сократических диалогов Платона о том, истинное знание осуществляется через припоминание того, что созерцала душа в мире идей (в нашем случае "мир идей" - это внешняя относительно нейросети база знаний).

huggingface.co

bond005/meno-tiny-0.1 · Hugging Face

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

🔥3❤1👍1

6.63K viewsedited 11:46

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Сибирский Нейросетевой Помощник

Привет всем моим прекрасным подписчикам в Telegram! Я хочу пожелать вам, дорогие девушки, особый день 8 Марта. Это не только день любви и романтики, но и возможность почувствовать себя особой и ценной. Желаю вам счастья, успехов в жизни и всего самого лучшего. Пусть этот день наполнит вас теплом и радостью, как и ваша любовь к компьютерным наукам и программированию. Спасибо за то, что вы так активно следите за мной и делитесь своими мыслями и идеями.

❤‍🔥3❤3

344 views13:49

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Друзья, это для вас. Пользуйтесь 😊

220 viewsedited 16:06

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Ivan Bondarenko

Всем привет!

Я иногда занимаюсь построением RAG-пайплайнов и столкнулся с проблемой чанкинга. Часто чанкинг выполняется весьма примитивно: текст разбивается на группы токенов одинакового размера без учёта семантики. Люди же для повышения читабельности текстов делают свой "человеческий" чанкинг совершенно по-другому: на абзацы, то есть семантически однородные текстовые отрезки из одного или нескольких предложений ("сверхфразовые единства", как назвали бы это лингвисты).

Соответственно, я решил, что мне не помешает хороший, правильный чанкинг. Умный чанкинг. И я решил сделать его для себя. Основная идея умного чанкера - воспроизвести семантическое разбиение текста на чанки, характерное для людей, что повышает качество структуризации текстового корпуса и положительно влияет на работу RAG-системы.

Алгоритм умного чанкинга состоит из следующих шагов.

Шаг 1. Весь текст разбивается на отдельные предложения. Если язык текста - английский, то для разбиения на предложения используется функция sent_tokenize из библиотеки nltk, а если язык текста - русский, то для этой цели применяется функция sentenize из библиотеки razdel. Кроме того, дополнительным критерием завершения предложения может выступать наличие символа перехода на новую строку (опционально).

Шаг 2. Генерируется множество вариантов разбиения текста на два чанка:

вариант 1: первый чанк включает в себя первое предложение, а второй чанк - оставшиеся предложения со второго по последнее;
вариант 2: первый чанк включает в себя первое и второе предложение, а второй чанк - оставшиеся предложения с третьего по последнее;
вариант 3: первый чанк включает в себя первое, второе и третье предложения, а второй чанк - оставшиеся предложения с четвёртого по последнее;
и так далее…

Шаг 3. С помощью кросс-энкодера (например, BAAI/bge-reranker-v2-m3 или Alibaba-NLP/gte-multilingual-reranker-base) для каждого из вариантов разбиения текста на пару чанков считается семантическое сходство между первым и вторым чанками.

Шаг 4. Итоговым вариантом разбиения текста на два чанка считается такой вариант, для которого семантическое сходство между первым и вторым чанками минимально.

Для каждого из двух выделенных чанков описанная процедура повторяется рекуррентно до тех пор, пока чанки не получатся достаточно маленькими (меньше, чем наперёд заданная максимально допустимая длина чанка).

Получилось, кажется, неплохо. Экспертная оценка тестовых текстов показывает весьма "семантическое" разбиение на чанки по границам семантических переходов.

Делал для себя, но если вдруг кому-то ещё этот умный чанкер окажется полезным, то буду рад 😊

https://github.com/bond005/smart_chunker

GitHub

GitHub - bond005/smart_chunker: This is a smart chunker for efficient preparing of long document for RAG

This is a smart chunker for efficient preparing of long document for RAG - bond005/smart_chunker

🔥7👍4

505 views16:06

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Audio

Обсудили новости в мире искусственного интеллекта на радио "Серебряный дождь" https://vk.com/silverrainradionsk
В качестве приглашённого гостя наш директор по ИИ Иван Бондаренко.

Основные тезисы:

1. Классификация ИИ:
- Слабый и сильный искусственный интеллект.
- Суперинтеллект как следующий этап после общего ИИ.
2. Применение ИИ в робототехнике:
- Воплощенный ИИ (роботы, собаки).
- Примеры успешных проектов и исследований.
3. Проблемы и ошибки использования ИИ:
- Примеры некорректного применения ИИ (дизайн обложек книг).
- Юридические последствия использования ИИ в преступных целях.
4. Научные эксперименты с ИИ:
- Автоматизация рецензирования научных статей.
- Участие ИИ в международных конференциях.
5. Разработка российских ИИ-технологий:
- Новые версии языковых моделей от компаний Яндекс и Сбер.
- Перспективы выхода на мировой уровень.
6. Перспективы и вызовы:
- Возможности и ограничения российских разработок.
- Необходимость дальнейшего развития и совершенствования ИИ.

Ключевые слова:
Искусственный интеллект (ИИ),
Общий и сильный ИИ,
Суперинтеллект,
Робототехника,
Воплощенный ИИ,
Ошибки использования ИИ,
Рецензирование научных статей,
Российские ИИ-технологии,
Яндекс GPT 5 Pro,
Сбер GigaChat.

p.s. Помогали готовить пост системы ИИ Писец и Менон

🔥4❤1

340 viewsedited 17:18

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

0:10

This media is not supported in your browser

VIEW IN TELEGRAM

0:14

This media is not supported in your browser

VIEW IN TELEGRAM

Иван, Даниил и Роман передают привет с Бали 🙂👋

❤6👍6🔥4😎4

366 views07:40

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

0:23

This media is not supported in your browser

VIEW IN TELEGRAM

Уже 2й день на выставке.
Вчера пообщались с несколькими крупными фондами, получили позитивную обратную связь 😊
Сегодня выступление в Зале 1 с 12:00
Василиса: GPT как ребенок 😊

❤7🔥5👍4👨‍💻1

272 views07:52

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from НГУ|NSU

В НГУ пройдёт тринадцатая конференция «Artificial Intelligence and Natural Language» (AINL)

18-19 апреля 2025 года состоится тринадцатая конференция «Artificial Intelligence and Natural Language» (AINL) — крупнейшая восточноевропейская конференция по искусственному интеллекту и обработке текстов.

Мероприятия пройдут в старом корпусе НГУ, в аудитории 311 им. Академика А.И. Мальцева. На конференции выступят приглашенные спикеры: доктор наук, профессор Наталья Валентиновна Лукашевич из МГУ, а также управляющий директор SberDevices Сергей Марков.

Конференция AINL проводится с 2012 года, её материалы индексируются в SCOPUS. Цель конференции — объединить экспертов в области искусственного интеллекта и обработки естественного языка; создать платформу для обмена опытом, расширения контактов и поиска возможного сотрудничества. Конференция сочетает в себе черты промышленной выставки и научной конференции. В 2019 году она прошла в Тарту, Эстония, в 2023 году в Ереване, Армения, а в 2024 году — в Алматы, Казахстан.

Темы конференции:

- Обработка естественного языка
- Искусственный интеллект, глубокое обучение, машинное обучение для обработки естественного языка
- Информационный поиск
- Анализ социальных медиа и социальных сетей
- Генерация и распознавание речи, обработка устного языка
- Интерфейсы человек-компьютер, диалоговые системы
- Контекстный анализ, извлечение информации из текста
- Обнаружение плагиата, профилирование автора и определение авторства
- Машинный перевод, межъязыковые и многоязычные приложения
- Большие данные и анализ данных

— Конференция AINL'2025 будет включать работы в трех основных направлениях: доклады по технологиям и прикладным исследованиям, обзоры готовых приложений и продуктов, связанных с ИИ и NLP, демонстрации работающих прототипов или приложений. В этом году в рамках AINL проходило соревнование по детектированию сгенерированных текстов, узнать его результаты и выводы, которые сделали организаторы соревнования по его итогам можно будет в рамках специальной сессии, — отметила директор конференции Ольга Пивень.

Сотрудники Исследовательского центра в сфере искусственного интеллекта НГУ примут участие в предстоящей конференции. Центр существует с 2023 года. Главная цель работы Центра — разработать и подготовить к внедрению набор технологий «умного города» с использованием искусственного интеллекта, которые повысили бы качество жизни граждан и эффективность работы городского хозяйства.

Мероприятие проходит при поддержке компаний Сибирские Нейросети и MTS AI.

@nsuniversity

❤5🔥5👍1

257 views05:37

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Друзья, приходите 🙂

❤3🔥1

284 views05:38

About

Blog

Apps

Platform