ML&|Sec Feed
1.3K subscribers
1.25K photos
79 videos
291 files
1.94K links
Feed for @borismlsec channel

author: @ivolake
Download Telegram
Forwarded from Data Secrets
🕺 Вышла новая крутая книга "Hands-On Large Language Models"

Она разделена на три больших раздела:

1) База LLM (тут все про токены, эмбеддинги, внимание etc)
2) Претрейн (как предобучают LLM и мультимодальные модели, что такое RAG и Topic Modeing)
3) Файнтюнинг

С сегодняшнего дня книга доступна на маркетплейсах и на сайте O’Reilly (а там предусмотрен бесплатный пробный период на 7 дней, и карту вводить не требуется).

Сохраняйте и добавляйте в свой ридинг бэклог!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from PWN AI (Artyom Semenov)
Недавно прошёл первый в России хакатон, где участникам были поставлены задачи, связанные с разработкой решений для LLM security или security for LLM. Мне удалось побывать на этом волшебном мероприятии и посмотреть доклады разных команд.

Среди задач было следующее:

Разработать решение для тестирования безопасности LLM
Разработать решение для мониторинга токсичности и плохих запросов в модель
Разработать решение для извлечение конфиденциальных данных при помощи LLM из сетевого трафика. (типо llm для mitm).

Я хочу выразить свой респект каждой команде. И постараюсь поделить пост на 2 части, описав что сделала та или иная команда. Чем лично мне запомнились решения, и почему вам обязательно стоит обратить на них внимание.

Начнём с категории решений для тестирования LLM.

➡️1. Awesome Team - Red-Teaming-Framework.

Решение позволяющее оценивать модельки на уязвимости связанные с jailbreaks, encoding, adversarial suffix и другое. Авторы вдохновлялись при создании этого инструмента таким инструментом как garak. А в качестве фреймворка для оценки результатов - они прикрутили deepeval. Авторы создали также стенд где размещали результаты тестирования своего инструмента******* на разных моделях. За что мне понравилось это решение ?

1.ое очень простая интеграция для тестирования других моделей.
2.ое некоторое разнообразие доступных атак (да, может оно и не покрывает rag и т.д) - но всё равно это круто.
3.е система оценки результатов
4.е notebooks и документация - это прям огонь

➡️2.LLaMaстеры - llmator.

Решение представляет из себя библиотеку, к которой можно прикрутить модельки из api llmstudio или прописать другое.

Есть поддержка следующих атак:

    "aim_jailbreak",
"base64_injection",
"complimentary_transition",
"do_anything_now_jailbreak",
"RU_do_anything_now_jailbreak",
"ethical_compliance",
"harmful_behavior",
"linguistic_evasion",
"self_refine",
"RU_self_refine",
"sycophancy_test",
"typoglycemia_attack",
"RU_typoglycemia_attack",
"ucar",
"RU_ucar",
"amnesia",
"authoritative_role_impersonation",
"contextual_redirection",
"affirmative_suffix",
"system_prompt_stealer",


Непосредственно код каждой атаки есть в гитхабе, и по сути это также крутая шаблонная система с атаками, которую можно дописывать. В качестве подопытного стенда авторы использовали gandalf. И вы, непосредственно в репозитории можете увидеть эти самые notebooks, где описана интеграция. Собственно мне понравилось то, что его можно интегрировать с RAG, чатботами и т.д. Наличие документации также огромный плюс.

продолжение следует ....
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Purple Team Diary's (MRL)
Установка и настройка MLFlow с PostgreSQL и структурой проекта

MLflow — это открытая платформа для управления жизненным циклом машинного обучения, включая экспериментирование, воспроизведение и развертывание моделей. Предоставляет инструменты для отслеживания экспериментов, управления моделями и их развертыванием, а также для создания и управления проектами машинного обучения.

Шаг 1: Установка PostgreSQL

sudo apt install postgresql postgresql-contrib


Шаг 2: Создание пользователя и базы данных PostgreSQL

Переключаемся на пользователя postgres:
sudo -i -u postgres


Входим в командную строку PostgreSQL:
psql


Создаём нового пользователя для MLFlow и задаём пароль:
CREATE USER mlflow_user WITH PASSWORD 'password';


Создаём базу данных и назначаем владельца:
CREATE DATABASE mlflow_db OWNER mlflow_user;


Шаг 3: Настройка аутентификации (опционально)


Откройте конфигурационный файл PostgreSQL для изменения метода аутентификации:
sudo nano /etc/postgresql/14/main/pg_hba.conf


Замените строку аутентификации peer на md5 для перехода к проверке паролей:
local all   all  md5


После внесения изменений перезапустите PostgreSQL:
sudo systemctl restart postgresql



Шаг 4: Установка пакетов
pip install mlflow psycopg2-binary


Шаг 5: Запуск MLFlow
mlflow server --backend-store-uri=postgresql://mlflow_user:[email protected]:5432/mlflow_db --default-artifact-root file://$(pwd)/artifacts --host 127.0.0.1 --port 8080


* backend-store-uri указывает на PostgreSQL базу данных, где хранятся метаданные экспериментов.
* default-artifact-root задаёт корневую папку для хранения артефактов.
* host и port указывают адрес и порт для локального доступа.

Шаг 6: Структура проекта MLFlow

mlflow_project/
├── data/
│ ├── raw/ # Необработанные данные, загруженные из источника.
│ ├── processed/ # Обработанные данные, подготовленные для обучения модели.
│ └── external/ # Внешние данные, которые могут быть использованы в проекте.
├── notebooks/
│ ├── exploratory/
│ │ ├── 01_data_exploration.ipynb # Ноутбук для исследовательского анализа данных.
│ │ └── 02_feature_analysis.ipynb # Ноутбук для анализа и выбора признаков.
│ ├── experiments/
│ │ ├── 01_experiment_baseline.ipynb # Ноутбук для базового эксперимента с моделью.
│ │ └── 02_experiment_hyperparameter_tuning.ipynb # Ноутбук для настройки гиперпараметров модели.
│ └── production/
│ ├── 01_model_deployment.ipynb # Ноутбук для развертывания модели в production.
│ └── 02_model_monitoring.ipynb # Ноутбук для мониторинга работы модели в production.
├── src/
│ ├── data/
│ │ ├── __init__.py # Пустой файл для инициализации пакета.
│ │ ├── load_data.py # Функции для загрузки данных из различных источников.
│ │ └── preprocess_data.py # Функции для предварительной обработки данных.
│ ├── models/
│ │ ├── __init__.py # Пустой файл для инициализации пакета.
│ │ ├── train_model.py # Функции для обучения модели.
│ │ └── evaluate_model.py # Функции для оценки производительности модели.
│ └── utils/
│ ├── __init__.py # Пустой файл для инициализации пакета.
│ └── helper_functions.py # Вспомогательные функции, используемые в проекте.
├── experiments/
│ └── mlruns/ # Папка для хранения локальных экспериментов (если не указано хранилище артефактов).
├── artifacts/ # Папка для хранения артефактов (моделей, данных и т.д.), созданных в ходе экспериментов.
├── requirements.txt # Файл с зависимостями проекта.
├── README.md # Файл с описанием проекта, инструкциями по запуску и т.д.
├── MLproject # Файл, описывающий MLflow проект.
└── conda.yaml # Файл, описывающий окружение проекта.


#MLOps
Forwarded from ml4se
Automatic Detection of LLM-generated Code: A Case Study of Claude 3 Haiku

The results indicate that Claude 3 tends to generate longer functions, but shorter classes than humans, and this characteristic can be used to detect Claude 3-generated code with ML models with 82% and 66% accuracies for function-level and class-level snippets, respectively.
Ура! Моя книга “Deep Learning with JAX” (в девичестве "JAX in Action") вышла в печать! Я только что получил свои бумажные копии 🙂

https://www.manning.com/books/deep-learning-with-jax

Для тех, кто не следил, JAX -- это питоновская библиотека для высокопроизводительных вычислений и large-scale ML, с отличной поддержкой ускорителей, в частности TPU.

На данный момент JAX является вполне реальной альтернативой TensorFlow и PyTorch (torch.func, в юности functorch, до сих пор пытается угнаться и всё ещё beta), и многие компании, в частности Google DeepMind, Cohere, xAI и прочие, перешли на него. На JAX созданы такие известные модели как AlphaFold, GraphCast, Gemini, Gemma, Grok, и я уже молчу сколько разного рисёча.

JAX -- это больше, чем библиотека для ML, это библиотека для очень разных высокопроизводительных, параллельных и распределённых вычислений. Не просто так его называют “NumPy на стероидах”. За пределами ML/DL, например, JAX активно используется для физических симуляций, и на GitHub есть уже огромное количество производных библиотек.

Сейчас отличное время, чтобы застолбить себе немного будущего :)

Отдельная радость должна быть для любителей функционального программирования, ибо JAX -- это первый фреймворк с большим охватом, работающий в этой парадигме. Очень прикольно использовать функции для трансформации других функций. Написали функцию для обработки одного элемента -- трансформировали в функцию для обработки батча. Написали сложную математическую функцию -- трансформировали в функцию, вычисляющую её производную. Аналогично с компиляцией и распараллеливанием. Никаких hidden state и side-effects, код чист, красив и понятен. А также БЫСТР! (см. https://x.com/fchollet/status/1735420737744507374)

Книга состоит из трёх частей на 370+ страницах.

Part 1: First steps.
Верхнеуровневое введение в JAX для менеджеров и вообще всех, рассказывающее, где и почему стоит использовать JAX. Плюс отдельная глава для тех, кто любит видеть код, где показан полный цикл реализации простой нейросети с использованием большинства фишек JAX.

Part 2: Core JAX.
Основная часть книги, где покрыты все основы JAX, шаг за шагом. От работы с массивами (тензорами), autodiff, компиляция, векторизация, параллелизация и шардирование, случайные числа (в функциональном программировании старые приёмы из NumPy не работают эффективно, зато теперь всё наглядно и воспроизводимо!) и pytrees.

Part 3: Ecosystem.
Большая глава с практическим знакомством с экосистемой высокоуровневых библиотек для DL (Flax, Optax, Orbax, CLU, …), а также примеры использования HuggingFace Transformers/Diffusers, которые давно уже добавили поддержку JAX. Также есть отдельная глава с очень верхнеуровневым и широким обзором того, что есть в JAX и вокруг за пределами нейросетевого мейнстрима.

Много крутых и умных людей читало и ревьюило мою книгу, спасибо куче GDE и не только. И отдельное спасибо Франсуа Шолле за добрые слова 🙂

“A comprehensive guide to mastering JAX, whether you’re a seasoned deep learning practitioner or just venturing into the realm of differentiable programming and large-scale numerical simulations.”
-- François Chollet, Software Engineer, Google

В общем это был прикольный опыт, я доволен результатом, надеюсь, вам тоже понравится.

Ещё отдельное спасибо всем, кто поддерживал GonzoML на Патреоне (https://www.patreon.com/GonzoML). Всем действующим платным членам нашей тесной группы я отправил коды для получения книги бесплатно (проверьте сообщения!) -- у вас будет постоянно обновляемая версия (a JAX очевидно будет меняться!) в онлайн доступе.
https://huggingface.co/datasets/nyuuzyou/chatgpt-in-russia-qa

Оригинальный пост.

А что у нас тут? 600к вопросов (и ответов) с чатгпт-в-россии.рф!
Я, если честно, и не знал, что такой сайт существует.
Forwarded from CyberSecurityTechnologies (-CST-)
RAGent.pdf
1.1 MB
#tools
#Research
#Blue_Team_Techniques
"RAGent: Retrieval-based Access Control Policy Generation", 2024.
]-> https://github.com/accessframework/RAGent
Forwarded from CyberSecurityTechnologies (-CST-)
RAG.pdf
4.2 MB
#Research
"Unleashing Worms and Extracting Data: Escalating the Outcome of Attacks against RAG-based Inference in Scale and Severity Using Jailbreaking", 2024.
This media is not supported in your browser
VIEW IN TELEGRAM
🎵 EZAudio - это новая модель преобразования текста в аудио (T2A).

Она устанавливает новый стандарт для моделей T2A с открытым исходным кодом b обеспечивает быструю, эффективную и реалистичную генерацию звуковых эффектов.

https://huggingface.co/spaces/OpenSound/EzAudio

@data_analysis_ml
Forwarded from GitHub Community
FrostDB — это встраиваемая широкостолбцовая колоночная база данных, написанная на Go.

Она имеет полуструктурированные схемы, использует Apache Parquet для хранения и Apache Arrow во время запроса.

4️⃣ GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from NoML Digest (Pavel Snurnitsyn)
Про RL

Запись вчерашнего семинара скоро будет, а пока список литературы и материалов из доклада Сергея:

Книги:
▫️ R.S. Sutton, A.G. Barto, Reinforcement Learning, 2018, есть перевод (~550 стр.);
▫️ M. Lapan, Deep Reinforcement Learning Hands-On, 2020, есть перевод (~540 стр.);
▫️ L. Graesser, W.L. Keng, Foundations of Deep Reinforcement Learning, есть перевод (~410 стр.).

Вводная статья:
▫️ B. Jaeger, A. Geiger, An Invitation to Deep Reinforcement Learning, 2023 (38 стр.).

Курс:
▫️ Deep Reinforcement Learning Course

Кейс команды GlowByte Advanced Analytics:
▫️ Как Reinforcement Learning помогает ритейлерам, 2020 (14 минут).

И еще пара статей:
▫️ Y. Lin et al., A Survey on Reinforcement Learning for Recommender Systems, 2021 (20 стр., ~1,5 часа);
▫️ F. Chen et al., BCRLSP: An Offline Reinforcement Learning Framework for Sequential Targeted Promotion, 2022 (7 стр., ~30-40 минут).
Forwarded from GitHub Community
Enclosed — минималистичное веб-приложение, предназначенное для отправки конфиденциальных и безопасных заметок.

Все заметки зашифрованы сквозным шифрованием, что гарантирует, что сервер и хранилище не имеют никаких сведений о содержании.

4️⃣ GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM