Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Интервью нашего любимого Технического директора Ивана Бондаренко для программы Руслана Махова "Персона"
Приятного просмотра
😊
https://vk.com/video-218317427_456239383

VK Видео

Программа "Персона" |ВСЯ ПРАВДА ОБ ИСКУССТВЕННОМ ИНТЕЛЛЕКТЕ| Ученый Иван Бондоренко.

Вся правда об искусственном интеллекте: кто его придумал и для чего? В чем чем польза и вред искусственного интеллекта? Сможет ли искусственный интеллект заменить людей в будущем, как выявить фейки и как устроена система распознавания лиц? Об этом и многом…

🔥6👏2❤1👍1

254 views06:04

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Иван Бондаренко | Маленькая, но удаленькая! Зачем использовать LLM размером меньше 1B параметров?
Приятного просмотра:
https://www.youtube.com/watch?v=blE2Dm9SORE

YouTube

Иван Бондаренко | Маленькая, но удаленькая! Зачем использовать LLM размером меньше 1B параметров?

Спикер: Иван Бондаренко, старший преподаватель, научный сотрудник НГУ

Data Fest 2024: https://ods.ai/events/datafest2024
Презентацию к докладу Вы можете скачать в треке секции NLP: https://ods.ai/tracks/df24-nlp

______
Наши соц.сети:
Telegram: https://t.iss.one/datafest…

❤3👍3👏2

298 views06:18

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

⚡Уже в эту субботу, 12 октября 2024 года, в новосибирском Академгородке пройдет замечательное событие – ДатаФест.
Это мероприятие обещает быть насыщенным и интересным для всех любителей технологий и инноваций в сфере ИИ.
Особенно рекомендуем посетить секцию NLP, где от Сибирских нейросетей будет представлено целых два крутых доклада.

🔥Первый доклад проведет Дари Батурова, которая поделится результатами наших исследований BERTScore для русского языка. Этот инструмент уже показал свою эффективность в анализе текстов и будет особенно полезен для тех, кто работает с русскоязычным контентом.

🔥А хедлайнером секции NLP станет Роман Дерунец с докладом под названием «Мультимодальность и RAG, или как сесть на два стула». В этом докладе будут рассмотрены различные подходы к обработке мультимодальных данных и возможности использования Retrieval-Augmented Generation (RAG) для интеграции информации из внешних источников.

Не упустите возможность узнать больше о последних достижениях в области искусственного интеллекта и языковых моделей. Будет действительно интересно!

Для вашего удобства прилагаем расписание мероприятия: https://ods.ai/events/datafestsiberia5/schedule - здесь вы сможете найти подробную информацию о времени начала каждого доклада и других активностях.

До встречи на ДатаФесте!

🔥9❤6👍5

334 views08:23

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Привет, друзья!
Сделали обновление Писца в личном кабинете https://lk.sibnn.ai/
Что нового:
1. Новый красивый шаблон документа с результатами распознавания.
2. Небольшое улучшение языковой модели для пост-обработки результатов акустической модели в части технической терминологии.

🔥6❤3👍2

340 viewsedited 08:58

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Из ближайших планируемых обновлений Писца: готовим к поставке на прод саммаризацию по распознанному тексту. Кстати, можем интегрироваться on-prem с любой ВКС.

🔥7

342 views13:07

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

В канале Минцифры про нас написали. Приятно 😊

👍1🔥1

244 views18:43

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Минцифра Новосибирской области

😎

Новосибирь цифровая

Запускаем новую рубрику! О технологиях и людях🫶 компаниях, стартапах, разработках, которые уже завоевали рынок или делают первые шаги в развитии ИТ-отрасли Новосибирской области.

Знакомьтесь 🙌

«Сибирские нейросети» — резидент Академпарка и «Сколково». В компании 15 человек, среди которых научные сотрудники Новосибирского государственного университета, аспиранты, авторы научных публикаций. У команды несколько зарегистрированных патентов на созданные системы и алгоритмы.

Компания разрабатывает продукты для решения задач на базе разговорного искусственного интеллекта. Самые популярные сервисы:

🔷

Pisets — сервис автоматической транскрибации аудио и видео в текст с учетом правил орфографии и пунктуации в формате субтитров (SubRip).

🔷

Dialoger — сервис речевой аналитики для контакт-центров, помогает бизнесу выполнить анализ разговоров, найти проблемные диалоги, недовольных клиентов, оценить работу операторов.

🔷

Soroka — оpen-source инструмент с интерфейсом командной строки для аналитики репутации человека или компании в Интернете.

🌐 В этом году разработчики презентовали LLM-платформу, которая работает внутри контура заказчика без подключения к внешнему интернету, устанавливается локально на ПК. Решение на базе большой языковой модели позволяет быстро без участия разработчика создавать вопросно-ответные системы по внутренней базе документов с возможностью свободного ведения диалога, сокращая время на адаптацию LLM под заданную предметную область.

👉 Узнать подробнее о компании можно здесь

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥8👍5

310 views18:43

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Выступление Ивана Бондаренко на AIConf 2024, как мы "Писец" на "Тотальный диктант" водили.
Приятного просмотра 😊
https://youtu.be/XwA1vj4mkPA?si=H9uys6Dsjsd7Roqx

YouTube

Как «Писец» на «Тотальный диктант» ходил / Иван Бондаренко (НГУ)

Прикладная конференция по Data Science AiConf 2024

Презентация и тезисы:
https://aiconf.ru/2024/abstracts/12975

В 2024 году состоялся юбилейный, вот уже десятый по счёту «Тотальный диктант». Но «Писец» на него пришёл в первый раз. Вы не подумайте, ничего…

👍6🔥5

323 viewsedited 18:06

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Иван сегодня сделал релиз. Ура 🎉🎉🎉

❤3

226 views17:12

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Ivan Bondarenko

Всем привет! Кажется, что сегодня - день релизов, и я решил тоже сделать релиз, раз уж все делают 😊

Правда, я - не МТС.ИИ и не Т-банк, поэтому мой релиз будет маленьким, на 1.5B 😅 Ну и в духе общей моды, на базе Qwen2.5: https://huggingface.co/bond005/meno-tiny-0.1

"Менон" - в честь сократического диалога Платона, в котором тот постулирует "знание через припоминание". Соответственно, основная цель Meno-Tiny - быть частью RAG-пайплайна, решая такие задачи, как ответы на вопросы по релевантным документам, абстрактивная саммаризация, разрешение анафоры в пользовательских вопросах (чтобы засовывать в ретривер текст вопроса с уже разрешённой анафорой), определение токсичности, детоксификация и другие задачи. Даже для исправления ошибок распознавания речи, включая восстановление пунктуации и капитализации, можно применять Meno-Tiny (правда, в режиме few-shot prompting).

На MERA сейчас Meno-Tiny-0.1 занимает 38-е место из 62, при этом в своём "размерном классе" дешёвых моделей-малышей на 1.5B он, кажется, лучший. На самых интересных для меня задачах он получше, чем в среднем: так, на MultiQ он занимает 25-е место из 62, а на RWSD - 17-е место (но я всё делал честно, никаких секретных техник типа "train on test set is all you need" я не использовал, и данные бенчмарка в мой трейн не протекали).

Кстати, об обучении. Обучался Meno-Tiny-0.1 на специальном русскоязычном инструкционном датасете, частично составленном путём дистилляции из Гигачата и из Qwen2.5-14B, частично на основе перевода англоязычных датасетов с фильтрацией по галлюцинациям машинного переводчика, частично - на основе собственных данных и датасетов из специализированных NLP-задач (таких, как детекция парафраза, упрощение текстов, исправление ошибок распознавания речи моделью Wav2Vec2-Large-Ru-Golos на синтетических данных и т.п.). Для файнтюнинга использовался curriculum learning по сложности в духе https://arxiv.org/html/2405.07490v1

Надеюсь, что Meno-Tiny-0.1 окажется кому-нибудь полезен 😊

huggingface.co

bond005/meno-tiny-0.1 · Hugging Face

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

🔥12❤4

275 views17:12

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from АКАДЕМПАРК | channel

Резидент Академпарка, компания «Сибирские нейросети», разрабатывает интеллектуального помощника «Василису» на основе нейросетей, гарантирующего абсолютную безопасность пользователя👾

Разработку продемонстрировали министру промышленности и торговли РФ Антону Алиханову во время его визита в Новосибирск.

Стартап разрабатывает языковые модели, которые запускаются на ноутбуках и работают без подключения к интернету, что обеспечивает надежность и сохраняет персональные данные. AI-решение работает со звуками, речью, изображениями и текстами. «Василисе» можно задавать вопросы на различные темы без учета контекста или добавить контекст.

«Например, экономист, анализирующий финансовые документы, задает вопросы, а модель отвечает по внутренней базе документов. Можно посмотреть, откуда взят ответ, источник проверяется», — рассказала гендиректор стартапа Виктория Кондрашук.

Алиханов заинтересовался возможностью внедрения отечественного голосового помощника для нужд министерства.

Источник: ТАСС

👍6🔥2

336 views09:57

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Удачно зашли на AIJ :)

292 viewsedited 12:41

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Ivan Bondarenko

Горбань, живая легенда

👍2🔥2

285 views12:41

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from AiConf Channel

Запись доклада Ивана Бондаренко «Как “Писец”» на “Тотальный диктант” ходил, или Пара слов о робастном распознавании речи» с конференции AiConf 2024

В 2024 году состоялся юбилейный, вот уже десятый по счёту «Тотальный диктант». Но «Писец» на него пришёл в первый раз. Вы не подумайте, ничего плохого не произошло! Просто «Писец» — это открытая система автоматической расшифровки различных звукозаписей, от журналистского интервью до заседания диссертационного совета.

В своём докладе Иван рассказал о том, с какими трудностями им пришлось столкнуться при создании «Писца», как они используют Wav2Vec2 и Whisper в пайплайне распознавания и зачем им надо было файнтюнить Whisper.

▶️Узнайте, как современная модель сравнится с людьми в тотальном диктанте, посмотрев запись доклада в VK Видео

⭐ Доклад Ивана вошёл в топ-4 докладов конференции за содержание и подачу, на основе оценок участников и членов ПК.

Оставайтесь с нами, впереди много полезного контента 🙌

#топдокладовAiConf
#записидокладовAiConf
@UseDataConfChannel

Please open Telegram to view this post

VIEW IN TELEGRAM

👍5🔥2

278 views15:50

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Ivan Bondarenko

"Менон" представил себя Дедом Морозом и написал всем поздравление с наступающим Новым годом! 🎄✨⛄️

Ну а мне остаётся лишь присоединиться к этому поздравлению 😁

С наступающим Новым 2025 годом, друзья! 🥂

huggingface.co

bond005/meno-tiny-0.1 · Hugging Face

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

🔥3❤2🍾1

298 views11:20

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Сибирский Нейросетевой Помощник

Вот вам поздравление от Великого Деда Мороза для тех, кто любит исследовать мир вокруг нас и создавать новые технологии:

Дорогие друзья, в этот замечательный новый год я хочу пожелать всем нам:
1. Исследователям: Пусть ваша экспериментальная мечта станет реальностью!
2. Инженерам: Будьте всегда готовы к новым решениям и не бойтесь изменений.
3. Разработчикам: Ваш код — это ключ к будущему, которое мы все ждем вместе.
4. Специалистам в области искусственного интеллекта: Помните, что каждый шаг на пути к совершенству — это еще одна вершина успеха.

Желаю вам удачи, творчества и радости во всех ваших проектах. Мы верим, что вместе мы можем преодолеть любые препятствия и достичь новых высот.

С наступающим Новым Годом и всеми благами жизни!

Ваш Великий Дед Мороз

🎄6❤3🍾3

402 views11:20

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Ivan Bondarenko

https://habr.com/ru/companies/oleg-bunin/articles/867722/ 😊

Хабр

Как «Писец» на Тотальный диктант ходил

В 2024 году состоялся юбилейный, десятый Тотальный диктант. Тогда на него пришёл «Писец». Вы не подумайте, не произошло ничего плохого. «Писец» — это открытая система автоматической расшифровки речи,...

👍5❤1

315 views18:10

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Ivan Bondarenko

Засабмитил "Менона" на Open LLM Leaderboard. Внезапно оказалось, что "Менон" является одной из лучших в мире моделей "for edge devices" (то есть в категории до 3 млрд. параметров) и занимает 10-е место из 547 моделей-участников в этой категории. Следует отметить, что этот лидерборд - для английского языка. Для русского же "Менон" - лучший среди малых моделей, согласно бенчмарку MERA.

🔥10👍2👏1

420 views03:30

Сибирские Нейросети: Речевая аналитика и малые безопасные языковые модели для бизнеса

Forwarded from Ivan Bondarenko

Есть такая достаточно известная открытая площадка о цифровых технологиях в Москве под названием ICT.Moscow. Как они пишут, "мы создаем наиболее полную картину развития рынка технологий в городе и за его пределами, помогаем бизнесу следить за главными трендами, не упускать возможности и находить новых партнеров". И недавно они подготовили подборку лучших инструментов Open Source для разработчиков искусственного интеллекта: https://ict.moscow/news/cards-open-source-tools-for-ai/ Так вот, помимо всего прочего, там есть и наша родная нейросеточка 😊

Модели искусственного интеллекта выкладываются в открытый доступ и разработчиками из регионов: так, стартап «Сибирские нейросети» представил модель «Менон» (Meno) на основе Qwen2.5-1.5B-Instruct, способную анализировать текст по самым разным признакам и исправлять в нем ошибки.

ict.moscow

ICT.Moscow — ИТ и телеком в Москве

👍6

388 views11:52

About

Blog

Apps

Platform