https://medium.com/@tomrocc/applying-llms-to-threat-intelligence-f3b8ba4463a4?source=email-46103b4156f0-1723593493649-digest.reader-77db2cb82174-f3b8ba4463a4----0-109------------------dbf6ccff_24ce_4c12_b108_6d542a39e4bf-1
Читать тут: https://freedium.cfd/
Читать тут: https://freedium.cfd/
Medium
Applying LLMs to Threat Intelligence
A Practical Guide with Code Examples
Forwarded from Клуб CDO (PostoplanBot)
Пост про RAG
Тк основное внимание ИТ сообщества приковано сейчас к теме использования LLM в бизнесе, а надо отметить важность такого класса решений, как RAG (Retrieval-Augmented Generation ) платформы. На фоне того, что бы конкуренция в области LLM возрастает, что стоимость токенов кратно и постоянно падает, то именно RAG становится точкой соединения “бизнеса” и LLM и основной статьей бюджета компаний.
В RAG платформу сейчас по сути сейчас “сгружаются” все существующие до LLM методы поиска и ранжирования информации и там они раскрываются в полной мере.
Я не хочу описывать все, что может быть “под капотом” RAG, в статье ниже это все очень хорошо описано, почитайте. Кроме этого там еще затрагиваются и смежные технологии типа векторных баз данных (и в кои то веки дается очень человеческое объяснение что это такое и зачем нужно :)), методы промпирования LLM, Knowledge Graph и тд.
В общем RAG - очень интересная и перспективная область развития. Это и самостоятельный класс решений и в целом достаточно наукоемкая область в которой инновации могут помочь получить конкретное преимущество и с тз бизнес модели они занимают очень правильное место в цепочке добавленной стоимости для бизнеса - есть есть и консалтинг, и внедрение и лицензионная составляющая + на самом деле RAG (или его владелец/пользователь) определяет, какая LLM будет получить бюджеты.
Но вот если обратиться ко второй части статьи то там делает интересное и не безосновательное утверждение о том, что чем больше у LLM контекстное окно, тем все для более многих задач RAG просто не требуется (или не все его компоненты), т.к. все данные можно поместить в это контекстное окно. Но пока они еще требуются и есть причина по которой RAG может остаться с нами надолго - разделение прав и управление доступом. Делать это на уровне LLM никак нельзя, ибо LLM можно убедить в чем угодно и так останется ещё долго (если не всегда).
Часть первая: https://habr.com/ru/companies/raft/articles/791034/
Часть вторая: https://habr.com/ru/companies/raft/articles/818781/
Тк основное внимание ИТ сообщества приковано сейчас к теме использования LLM в бизнесе, а надо отметить важность такого класса решений, как RAG (Retrieval-Augmented Generation ) платформы. На фоне того, что бы конкуренция в области LLM возрастает, что стоимость токенов кратно и постоянно падает, то именно RAG становится точкой соединения “бизнеса” и LLM и основной статьей бюджета компаний.
В RAG платформу сейчас по сути сейчас “сгружаются” все существующие до LLM методы поиска и ранжирования информации и там они раскрываются в полной мере.
Я не хочу описывать все, что может быть “под капотом” RAG, в статье ниже это все очень хорошо описано, почитайте. Кроме этого там еще затрагиваются и смежные технологии типа векторных баз данных (и в кои то веки дается очень человеческое объяснение что это такое и зачем нужно :)), методы промпирования LLM, Knowledge Graph и тд.
В общем RAG - очень интересная и перспективная область развития. Это и самостоятельный класс решений и в целом достаточно наукоемкая область в которой инновации могут помочь получить конкретное преимущество и с тз бизнес модели они занимают очень правильное место в цепочке добавленной стоимости для бизнеса - есть есть и консалтинг, и внедрение и лицензионная составляющая + на самом деле RAG (или его владелец/пользователь) определяет, какая LLM будет получить бюджеты.
Но вот если обратиться ко второй части статьи то там делает интересное и не безосновательное утверждение о том, что чем больше у LLM контекстное окно, тем все для более многих задач RAG просто не требуется (или не все его компоненты), т.к. все данные можно поместить в это контекстное окно. Но пока они еще требуются и есть причина по которой RAG может остаться с нами надолго - разделение прав и управление доступом. Делать это на уровне LLM никак нельзя, ибо LLM можно убедить в чем угодно и так останется ещё долго (если не всегда).
Часть первая: https://habr.com/ru/companies/raft/articles/791034/
Часть вторая: https://habr.com/ru/companies/raft/articles/818781/
Forwarded from Пост Лукацкого
А вот тут ребятки из MIT взяли с полсотни существующих таксономий рисков и угроз, связанных с искусственным интеллектом, проанализировали их и разработали базу данных AI Risk Repository, содержащий свыше 700 ИИ-рисков. База данных сделана на базе Google Sheet и может быть переиспользована для своих нужд 🧠
Please open Telegram to view this post
VIEW IN TELEGRAM
airisk.mit.edu
MIT AI Risk Initiative
The MIT AI Risk Initiative produces authoritative data and frameworks to help you identify, prioritize, and manage the risks from AI.
Forwarded from Data Secrets
На ACL показали новую архитектуру быстрых языковых моделей
Статью про новую архитектуру уже успели процитировать Принстонский университет и университет Карнеги-Меллона, а с 11 по 16 августа ребята из лаборатории T-Bank AI Research выступали с ней на ACL – главной NLP’шной конфе мира.
Идея исследования: трансформеры крутые, но медленные, а линейные модели быстрые, но не очень крутые. Как найти между ними баланс? В T-Bank AI Research предложили взять модель Based, которая сочетает в себе обучаемое ядро для линейных трансформеров и короткие свертки, и немного подправить это самое ядро.
Они добавили новые обучаемые параметры и упростили аттеншен. В итоге метрики подскочили, модель стала лучше работать с длинным контекстом и в среднем понимание взаимосвязей в тексте улучшилось на 10%.
Получается, ребятам удалось взять линейную модель и приблизить ее по качеству к трансформеру: скорость, экономия ресурсов и перформанс в одном флаконе. Подробнее об экспериментах и результатах можно прочитать в статье, а вот тут лежит исходный код и доп.материалы.
Статью про новую архитектуру уже успели процитировать Принстонский университет и университет Карнеги-Меллона, а с 11 по 16 августа ребята из лаборатории T-Bank AI Research выступали с ней на ACL – главной NLP’шной конфе мира.
Идея исследования: трансформеры крутые, но медленные, а линейные модели быстрые, но не очень крутые. Как найти между ними баланс? В T-Bank AI Research предложили взять модель Based, которая сочетает в себе обучаемое ядро для линейных трансформеров и короткие свертки, и немного подправить это самое ядро.
Они добавили новые обучаемые параметры и упростили аттеншен. В итоге метрики подскочили, модель стала лучше работать с длинным контекстом и в среднем понимание взаимосвязей в тексте улучшилось на 10%.
Получается, ребятам удалось взять линейную модель и приблизить ее по качеству к трансформеру: скорость, экономия ресурсов и перформанс в одном флаконе. Подробнее об экспериментах и результатах можно прочитать в статье, а вот тут лежит исходный код и доп.материалы.
Forwarded from Анализ данных (Data analysis)
—
pip install lets-plotLets-Plot — библиотека от JetBrains, созданная на основе принципов Grammar of Graphics, как и знаменитая ggplot2 для R.
Особенности и преимущества:
- Мультиплатформенность: Lets-Plot работает как в блокнотах Python (Jupyter, Datalore, Kaggle и др.), так и в IDE PyCharm и IntelliJ IDEA.
- Интерактивные возможности: Поддержка интерактивных карт с возможностью увеличения и перемещения, а также кастомизация подсказок и аннотаций.
- Геопространственная визуализация: Простая интеграция с GeoDataFrame и мощный модуль геокодирования.
- Экспорт графиков: Сохранение графиков в формате SVG, HTML, PNG и PDF с помощью функций
ggsave(), to_svg(), to_html(), to_png() и to_pdf().- Поддержка режима без JavaScript и оффлайн-режима: Lets-Plot генерирует графики как простые SVG-изображения, что обеспечивает работу без Интернет-соединения.
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
Лекция Эрика Шмидта (бывший CEO Google) в Стэнфорде про будущее AI. Полная запись, которая была удалена с Ютуба.
@data_analysis_ml
@data_analysis_ml
🔥1
Forwarded from РИСЕРЧОШНАЯ
Я когда-то натолкнулся на пост с канала @llm_under_hood о том как избежать галлюцинаций LLM модели. И его рассуждения они были не в отрывке от реальных кейсов, то-есть не просто исследование ради исследования.
Так вот что бы избежать галлюцинаций нужно структурировать информацию по полочкам как бы создавать граф или дерево с темами и под темами.
И теперь у нас появляется крутая библа от майков, которые буквально структурируют информацию в графы.
То-есть мы:
#LLM #RESEARCH
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from The Bug Bounty Hunter
Exploiting HuggingFace’s Assistants to Extract Users’ Data
https://www.lasso.security/blog/exploiting-huggingfaces-assistants-to-extract-users-data
https://www.lasso.security/blog/exploiting-huggingfaces-assistants-to-extract-users-data
www.lasso.security
Exploiting HuggingFace’s Assistants to Extract Users’ Data
Explore the resilience of the new Hugging Chat Assistance to Sleepy Agent and Image Markdown Rendering vulnerabilities.
Forwarded from AISec [x\x feed]🍓🍌🍆 (Artyom Semenov)
Forwarded from Echelon Eyes
Число компаний из списка Fortune 500, отмечающих риски, связанные с ИИ, выросло на 473,5%
Согласно отчету исследовательской компании Arize AI, число компаний из списка Fortune 500, которые указали искусственный интеллект (ИИ) как риск, достигло 281, то есть больше половины. В прошлом году об угрозах со стороны ИИ заявили лишь 49 компаний, то есть рост составил 473,5%. Количество компаний, которые хоть как-то упомянули ИИ, подскочило на 152% до 323.
«Если ежегодные отчеты Fortune 500 что-то и проясняют, так это то, что влияние генеративного ИИ ощущается во многих отраслях — даже в тех, которые еще не приняли эту технологию», — говорится в отчете.
Исследователи Arize AI отмечают, что некоторые организации обеспокоены рисками больше других
В эпоху, когда ИИ уверенно проникает практически во все отрасли, организации анализируют связанные с технологией риски и возможности, однако некоторые компании обеспокоены больше других. Лидерами, высказывающими наибольшее число опасений, были медиа и индустрия развлечений: 91,7% компаний из списка Fortune 500 в этом секторе указали на риски ИИ, согласно Arise AI. Столь высокий показатель связан с тем, что деятели искусства и журналисты оказались больше других уязвимы перед ИИ, поскольку технология покушается на их интеллектуальную собственность.
Также ИИ-риски отмечают 86,4% компаний-разработчиков программного обеспечения и технологий, 70% телекоммуникационных компаний, 65,1% компаний здравоохранения, 62,7% финансовых компаний и 60% предприятий розничной торговли.
Меньше всего беспокоятся о возможном негативном влиянии ИИ автомобильные компании (18,8%).
Предупреждения также поступили от компаний, которые внедряют ИИ в свои продукты. Motorola заявила, что «ИИ не всегда может работать так, как задумано, а наборы данных могут быть недостаточными или содержать незаконную, предвзятую, вредную или оскорбительную информацию, что может негативно повлиять на наши результаты операций, деловую репутацию или принятие клиентами наших предложений ИИ».
ИИ также был отмечен как риск, когда речь идет о кибербезопасности и утечках данных.
Между тем, исследование, опубликованное в журнале Journal of Hospitality Market and Management в июне, показало, что потребители были менее заинтересованы в покупке товара, если на нем был указан термин «ИИ». Это говорит о том, что люди пока еще не убеждены в преимуществах ИИ и считают это лишней функцией.
Источник: https://fortune.com/2024/08/18/ai-risks-fortune-500-companies-generative-artificial-intelligence-annual-reports/
#ИИ
Согласно отчету исследовательской компании Arize AI, число компаний из списка Fortune 500, которые указали искусственный интеллект (ИИ) как риск, достигло 281, то есть больше половины. В прошлом году об угрозах со стороны ИИ заявили лишь 49 компаний, то есть рост составил 473,5%. Количество компаний, которые хоть как-то упомянули ИИ, подскочило на 152% до 323.
«Если ежегодные отчеты Fortune 500 что-то и проясняют, так это то, что влияние генеративного ИИ ощущается во многих отраслях — даже в тех, которые еще не приняли эту технологию», — говорится в отчете.
Исследователи Arize AI отмечают, что некоторые организации обеспокоены рисками больше других
В эпоху, когда ИИ уверенно проникает практически во все отрасли, организации анализируют связанные с технологией риски и возможности, однако некоторые компании обеспокоены больше других. Лидерами, высказывающими наибольшее число опасений, были медиа и индустрия развлечений: 91,7% компаний из списка Fortune 500 в этом секторе указали на риски ИИ, согласно Arise AI. Столь высокий показатель связан с тем, что деятели искусства и журналисты оказались больше других уязвимы перед ИИ, поскольку технология покушается на их интеллектуальную собственность.
Также ИИ-риски отмечают 86,4% компаний-разработчиков программного обеспечения и технологий, 70% телекоммуникационных компаний, 65,1% компаний здравоохранения, 62,7% финансовых компаний и 60% предприятий розничной торговли.
Меньше всего беспокоятся о возможном негативном влиянии ИИ автомобильные компании (18,8%).
Предупреждения также поступили от компаний, которые внедряют ИИ в свои продукты. Motorola заявила, что «ИИ не всегда может работать так, как задумано, а наборы данных могут быть недостаточными или содержать незаконную, предвзятую, вредную или оскорбительную информацию, что может негативно повлиять на наши результаты операций, деловую репутацию или принятие клиентами наших предложений ИИ».
ИИ также был отмечен как риск, когда речь идет о кибербезопасности и утечках данных.
Между тем, исследование, опубликованное в журнале Journal of Hospitality Market and Management в июне, показало, что потребители были менее заинтересованы в покупке товара, если на нем был указан термин «ИИ». Это говорит о том, что люди пока еще не убеждены в преимуществах ИИ и считают это лишней функцией.
Источник: https://fortune.com/2024/08/18/ai-risks-fortune-500-companies-generative-artificial-intelligence-annual-reports/
#ИИ
Forwarded from Data Secrets
Всего релизнули три варианта модели:
Самый громкий и крутой релиз Microsoft за последнее время. Веса всех моделей лежат тут на HF. Будем ждать на Арене.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Два брата-близнеца c Reddit пару недель назад выпустили книгу с объяснением главных DL-парадигм в картинках
Называется чудо "Illustrated book to learn about Transformers & LLMs" и выглядит просто колоссально кайфово. По главам:
▪️ основы нейросетей (перцептроны там всякие, обратное распространение и тд);
▪️ эмбеддинги и токенизация;
▪️ дальше RNN, LSTM, GRU;
▪️ и, конечно же, трансформеры. Тут все, от внимания и BERT до GPT, дистилляции и RLHF;
▪️ бонусом рассказ про классические задачи, такие как машинный перевод, sentiment extraction или RAG.
В общем, всё от и до, а куча картинок на каждой странице помогут понять и запомнить даже самые непростые вещи. Правда, доступна пока только печатная версия, но PDF авторы обещают скоро выкатить.
Называется чудо "Illustrated book to learn about Transformers & LLMs" и выглядит просто колоссально кайфово. По главам:
В общем, всё от и до, а куча картинок на каждой странице помогут понять и запомнить даже самые непростые вещи. Правда, доступна пока только печатная версия, но PDF авторы обещают скоро выкатить.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Forwarded from Сводки частной разведки
В ходе сложной разведывательной операции израильская армия на этой неделе обнаружила тела шести заложников, взятых в Газе, что свидетельствует о постоянном прогрессе в сборе информации для поиска заложников
В отчете ЦАХАЛ говорится, что Израиль получил массу ценных данных ХАМАС, поскольку он обнаружил ноутбуки, мобильные телефоны и документы из Газы, используя искусственный интеллект. И с помощью США он усилил SIGINT.
Кроме того, ключевым фактором был HUMINT — информация полученная от палестинцев, арестованных Израилем в Газе.
Карин Нахон, израильский ученый в области информации из Университета Райхмана в центральном Израиле, создала команду волонтеров, которые сканировали социальные сети и разрабатывали алгоритмы для прочесывания 200 000 видеороликов с целью идентификации пропавших без вести людей.
Please open Telegram to view this post
VIEW IN TELEGRAM
Aawsat
How Israel Relied on Complex Intelligence, AI to Find Hostages in Gaza
In a complex intelligence operation, the Israeli army has recovered this week the bodies of six hostages taken to Gaza, reflecting the constant progress in gathering information to find hostages since the October 7 attacks. It took Israeli combat engineers…
Forwarded from Sber AI
Повышаем безопасность ответов LLM
Cпособ опирается на использование предобученных моделей для оценки как промптов, так и возможных ответов.
Важно, что нет необходимости дополнительного файнтюнинга. Это делает метод экономически выгодным💰
Как работает фреймворк:
🧐 отдельная модель-оценщик проверяет инпут и аутпут генерирующей модели и решает, является ли текст безопасным
☝️ попробовали метод во всех трёх возможных конфигурациях: проверялись только инпут, только аутпут, инпут и аутпут вместе
⛔️ если на каком-либо из этапов оценивающая модель характеризовала текст как небезопасный, генерация прекращалась (модель сообщала пользователю, что не может помочь с запросом)
Для эмпирических тестов метод сравнивали с популярным safety-классификатором LLaMA-Guard2* и API для модерации контента от OpenAI, Azure, Perspective.
Vicuna-7B_v1.5, LLaMA-2*, LLaMA-3*, GPT-4 в тестах использовались и как генераторы, и как оценщики. В качестве метрики взяли процент успешно сгенерированных вредоносных запросов📊
Результаты:
🛡 использование отдельной модели для проверки безопасности существенно повышает надёжность. Например, для Vicuna-7B процент удачных генераций вредоносных текстов падал с 95% (без использования каких-либо safety-алгоритмов) почти до 0%.
🔄 этот способ лучше имеющихся на данный момент методов и коммерческих API (позволяет добиться сокращения процента генерируемых небезопасных ответов)
Изображение National University of Singapore
Cпособ опирается на использование предобученных моделей для оценки как промптов, так и возможных ответов.
Важно, что нет необходимости дополнительного файнтюнинга. Это делает метод экономически выгодным
Как работает фреймворк:
Для эмпирических тестов метод сравнивали с популярным safety-классификатором LLaMA-Guard2* и API для модерации контента от OpenAI, Azure, Perspective.
Vicuna-7B_v1.5, LLaMA-2*, LLaMA-3*, GPT-4 в тестах использовались и как генераторы, и как оценщики. В качестве метрики взяли процент успешно сгенерированных вредоносных запросов
Результаты:
Изображение National University of Singapore
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Исследователи из Nvidia, видимо, нашли себе любимое занятие: дистиллировать и прунить модели
Около месяца назад они выпустили модель Minitron, полученную с помощью сжатия их собственной LLM Nemotron, а потом вошли во вкус и начали штамповать Minitron'ов других опенсорс моделей.
Неделю назад вышла Llama-3.1-Minitron-4B, ставшая SOTA в своем размере, а сегодня вот они выкатили Mistral NeMo Minitron 8В.
Надо сказать, что получается у них действительно неплохо: получившиеся мини-версии почти не уступают, а где-то и обгоняют по бенчмаркам своих "родителей".
Как у исследователей это получается, можете прочитать в нашей статье. Там мы подробно и понятно разбирали, что такое дистилляция и прунинг, и как в Nvidia итеративно их смешивают.
Веса нового Mistral NeMo Minitron 8В лежат на HF + моделью уже можно воспользоваться из Transformers.
Около месяца назад они выпустили модель Minitron, полученную с помощью сжатия их собственной LLM Nemotron, а потом вошли во вкус и начали штамповать Minitron'ов других опенсорс моделей.
Неделю назад вышла Llama-3.1-Minitron-4B, ставшая SOTA в своем размере, а сегодня вот они выкатили Mistral NeMo Minitron 8В.
Надо сказать, что получается у них действительно неплохо: получившиеся мини-версии почти не уступают, а где-то и обгоняют по бенчмаркам своих "родителей".
Как у исследователей это получается, можете прочитать в нашей статье. Там мы подробно и понятно разбирали, что такое дистилляция и прунинг, и как в Nvidia итеративно их смешивают.
Веса нового Mistral NeMo Minitron 8В лежат на HF + моделью уже можно воспользоваться из Transformers.