Forwarded from Purple Team Diary's (MRL)
Установка и настройка MLFlow с PostgreSQL и структурой проекта
MLflow — это открытая платформа для управления жизненным циклом машинного обучения, включая экспериментирование, воспроизведение и развертывание моделей. Предоставляет инструменты для отслеживания экспериментов, управления моделями и их развертыванием, а также для создания и управления проектами машинного обучения.
Шаг 1: Установка PostgreSQL
Шаг 2: Создание пользователя и базы данных PostgreSQL
Переключаемся на пользователя postgres:
Входим в командную строку PostgreSQL:
Создаём нового пользователя для MLFlow и задаём пароль:
Создаём базу данных и назначаем владельца:
Шаг 3: Настройка аутентификации (опционально)
Откройте конфигурационный файл PostgreSQL для изменения метода аутентификации:
Замените строку аутентификации peer на md5 для перехода к проверке паролей:
После внесения изменений перезапустите PostgreSQL:
Шаг 4: Установка пакетов
Шаг 5: Запуск MLFlow
* backend-store-uri указывает на PostgreSQL базу данных, где хранятся метаданные экспериментов.
* default-artifact-root задаёт корневую папку для хранения артефактов.
* host и port указывают адрес и порт для локального доступа.
Шаг 6: Структура проекта MLFlow
#MLOps
MLflow — это открытая платформа для управления жизненным циклом машинного обучения, включая экспериментирование, воспроизведение и развертывание моделей. Предоставляет инструменты для отслеживания экспериментов, управления моделями и их развертыванием, а также для создания и управления проектами машинного обучения.
Шаг 1: Установка PostgreSQL
sudo apt install postgresql postgresql-contrib
Шаг 2: Создание пользователя и базы данных PostgreSQL
Переключаемся на пользователя postgres:
sudo -i -u postgres
Входим в командную строку PostgreSQL:
psql
Создаём нового пользователя для MLFlow и задаём пароль:
CREATE USER mlflow_user WITH PASSWORD 'password';
Создаём базу данных и назначаем владельца:
CREATE DATABASE mlflow_db OWNER mlflow_user;
Шаг 3: Настройка аутентификации (опционально)
Откройте конфигурационный файл PostgreSQL для изменения метода аутентификации:
sudo nano /etc/postgresql/14/main/pg_hba.conf
Замените строку аутентификации peer на md5 для перехода к проверке паролей:
local all all md5
После внесения изменений перезапустите PostgreSQL:
sudo systemctl restart postgresql
Шаг 4: Установка пакетов
pip install mlflow psycopg2-binary
Шаг 5: Запуск MLFlow
mlflow server --backend-store-uri=postgresql://mlflow_user:[email protected]:5432/mlflow_db --default-artifact-root file://$(pwd)/artifacts --host 127.0.0.1 --port 8080
* backend-store-uri указывает на PostgreSQL базу данных, где хранятся метаданные экспериментов.
* default-artifact-root задаёт корневую папку для хранения артефактов.
* host и port указывают адрес и порт для локального доступа.
Шаг 6: Структура проекта MLFlow
mlflow_project/
├── data/
│ ├── raw/ # Необработанные данные, загруженные из источника.
│ ├── processed/ # Обработанные данные, подготовленные для обучения модели.
│ └── external/ # Внешние данные, которые могут быть использованы в проекте.
├── notebooks/
│ ├── exploratory/
│ │ ├── 01_data_exploration.ipynb # Ноутбук для исследовательского анализа данных.
│ │ └── 02_feature_analysis.ipynb # Ноутбук для анализа и выбора признаков.
│ ├── experiments/
│ │ ├── 01_experiment_baseline.ipynb # Ноутбук для базового эксперимента с моделью.
│ │ └── 02_experiment_hyperparameter_tuning.ipynb # Ноутбук для настройки гиперпараметров модели.
│ └── production/
│ ├── 01_model_deployment.ipynb # Ноутбук для развертывания модели в production.
│ └── 02_model_monitoring.ipynb # Ноутбук для мониторинга работы модели в production.
├── src/
│ ├── data/
│ │ ├── __init__.py # Пустой файл для инициализации пакета.
│ │ ├── load_data.py # Функции для загрузки данных из различных источников.
│ │ └── preprocess_data.py # Функции для предварительной обработки данных.
│ ├── models/
│ │ ├── __init__.py # Пустой файл для инициализации пакета.
│ │ ├── train_model.py # Функции для обучения модели.
│ │ └── evaluate_model.py # Функции для оценки производительности модели.
│ └── utils/
│ ├── __init__.py # Пустой файл для инициализации пакета.
│ └── helper_functions.py # Вспомогательные функции, используемые в проекте.
├── experiments/
│ └── mlruns/ # Папка для хранения локальных экспериментов (если не указано хранилище артефактов).
├── artifacts/ # Папка для хранения артефактов (моделей, данных и т.д.), созданных в ходе экспериментов.
├── requirements.txt # Файл с зависимостями проекта.
├── README.md # Файл с описанием проекта, инструкциями по запуску и т.д.
├── MLproject # Файл, описывающий MLflow проект.
└── conda.yaml # Файл, описывающий окружение проекта.
#MLOps
Forwarded from PWN AI (Artyom Semenov)
Пока имеем это
https://github.com/aryakvnust/LLMSecGuard
https://github.com/tuhh-softsec/LLMSecEval
https://github.com/s2e-lab/SecurityEval
спасибо кто откликнулся.
https://github.com/aryakvnust/LLMSecGuard
https://github.com/tuhh-softsec/LLMSecEval
https://github.com/s2e-lab/SecurityEval
спасибо кто откликнулся.
GitHub
GitHub - aryakvnust/LLMSecGuard: LLM Security Guard for Code
LLM Security Guard for Code. Contribute to aryakvnust/LLMSecGuard development by creating an account on GitHub.
Forwarded from AISec [x\x feed]🍓🍌🍆 (Artyom Semenov)
GitHub
GitHub - AndrewZhou924/Awesome-model-inversion-attack: [arXiv:2411.10023] "Model Inversion Attacks: A Survey of Approaches and…
[arXiv:2411.10023] "Model Inversion Attacks: A Survey of Approaches and Countermeasures" - AndrewZhou924/Awesome-model-inversion-attack
Forwarded from ml4se
Automatic Detection of LLM-generated Code: A Case Study of Claude 3 Haiku
The results indicate that Claude 3 tends to generate longer functions, but shorter classes than humans, and this characteristic can be used to detect Claude 3-generated code with ML models with 82% and 66% accuracies for function-level and class-level snippets, respectively.
The results indicate that Claude 3 tends to generate longer functions, but shorter classes than humans, and this characteristic can be used to detect Claude 3-generated code with ML models with 82% and 66% accuracies for function-level and class-level snippets, respectively.
Forwarded from gonzo-обзоры ML статей
Ура! Моя книга “Deep Learning with JAX” (в девичестве "JAX in Action") вышла в печать! Я только что получил свои бумажные копии 🙂
https://www.manning.com/books/deep-learning-with-jax
Для тех, кто не следил, JAX -- это питоновская библиотека для высокопроизводительных вычислений и large-scale ML, с отличной поддержкой ускорителей, в частности TPU.
На данный момент JAX является вполне реальной альтернативой TensorFlow и PyTorch (torch.func, в юности functorch, до сих пор пытается угнаться и всё ещё beta), и многие компании, в частности Google DeepMind, Cohere, xAI и прочие, перешли на него. На JAX созданы такие известные модели как AlphaFold, GraphCast, Gemini, Gemma, Grok, и я уже молчу сколько разного рисёча.
JAX -- это больше, чем библиотека для ML, это библиотека для очень разных высокопроизводительных, параллельных и распределённых вычислений. Не просто так его называют “NumPy на стероидах”. За пределами ML/DL, например, JAX активно используется для физических симуляций, и на GitHub есть уже огромное количество производных библиотек.
Сейчас отличное время, чтобы застолбить себе немного будущего :)
Отдельная радость должна быть для любителей функционального программирования, ибо JAX -- это первый фреймворк с большим охватом, работающий в этой парадигме. Очень прикольно использовать функции для трансформации других функций. Написали функцию для обработки одного элемента -- трансформировали в функцию для обработки батча. Написали сложную математическую функцию -- трансформировали в функцию, вычисляющую её производную. Аналогично с компиляцией и распараллеливанием. Никаких hidden state и side-effects, код чист, красив и понятен. А также БЫСТР! (см. https://x.com/fchollet/status/1735420737744507374)
Книга состоит из трёх частей на 370+ страницах.
Part 1: First steps.
Верхнеуровневое введение в JAX для менеджеров и вообще всех, рассказывающее, где и почему стоит использовать JAX. Плюс отдельная глава для тех, кто любит видеть код, где показан полный цикл реализации простой нейросети с использованием большинства фишек JAX.
Part 2: Core JAX.
Основная часть книги, где покрыты все основы JAX, шаг за шагом. От работы с массивами (тензорами), autodiff, компиляция, векторизация, параллелизация и шардирование, случайные числа (в функциональном программировании старые приёмы из NumPy не работают эффективно, зато теперь всё наглядно и воспроизводимо!) и pytrees.
Part 3: Ecosystem.
Большая глава с практическим знакомством с экосистемой высокоуровневых библиотек для DL (Flax, Optax, Orbax, CLU, …), а также примеры использования HuggingFace Transformers/Diffusers, которые давно уже добавили поддержку JAX. Также есть отдельная глава с очень верхнеуровневым и широким обзором того, что есть в JAX и вокруг за пределами нейросетевого мейнстрима.
Много крутых и умных людей читало и ревьюило мою книгу, спасибо куче GDE и не только. И отдельное спасибо Франсуа Шолле за добрые слова 🙂
“A comprehensive guide to mastering JAX, whether you’re a seasoned deep learning practitioner or just venturing into the realm of differentiable programming and large-scale numerical simulations.”
-- François Chollet, Software Engineer, Google
В общем это был прикольный опыт, я доволен результатом, надеюсь, вам тоже понравится.
Ещё отдельное спасибо всем, кто поддерживал GonzoML на Патреоне (https://www.patreon.com/GonzoML). Всем действующим платным членам нашей тесной группы я отправил коды для получения книги бесплатно (проверьте сообщения!) -- у вас будет постоянно обновляемая версия (a JAX очевидно будет меняться!) в онлайн доступе.
https://www.manning.com/books/deep-learning-with-jax
Для тех, кто не следил, JAX -- это питоновская библиотека для высокопроизводительных вычислений и large-scale ML, с отличной поддержкой ускорителей, в частности TPU.
На данный момент JAX является вполне реальной альтернативой TensorFlow и PyTorch (torch.func, в юности functorch, до сих пор пытается угнаться и всё ещё beta), и многие компании, в частности Google DeepMind, Cohere, xAI и прочие, перешли на него. На JAX созданы такие известные модели как AlphaFold, GraphCast, Gemini, Gemma, Grok, и я уже молчу сколько разного рисёча.
JAX -- это больше, чем библиотека для ML, это библиотека для очень разных высокопроизводительных, параллельных и распределённых вычислений. Не просто так его называют “NumPy на стероидах”. За пределами ML/DL, например, JAX активно используется для физических симуляций, и на GitHub есть уже огромное количество производных библиотек.
Сейчас отличное время, чтобы застолбить себе немного будущего :)
Отдельная радость должна быть для любителей функционального программирования, ибо JAX -- это первый фреймворк с большим охватом, работающий в этой парадигме. Очень прикольно использовать функции для трансформации других функций. Написали функцию для обработки одного элемента -- трансформировали в функцию для обработки батча. Написали сложную математическую функцию -- трансформировали в функцию, вычисляющую её производную. Аналогично с компиляцией и распараллеливанием. Никаких hidden state и side-effects, код чист, красив и понятен. А также БЫСТР! (см. https://x.com/fchollet/status/1735420737744507374)
Книга состоит из трёх частей на 370+ страницах.
Part 1: First steps.
Верхнеуровневое введение в JAX для менеджеров и вообще всех, рассказывающее, где и почему стоит использовать JAX. Плюс отдельная глава для тех, кто любит видеть код, где показан полный цикл реализации простой нейросети с использованием большинства фишек JAX.
Part 2: Core JAX.
Основная часть книги, где покрыты все основы JAX, шаг за шагом. От работы с массивами (тензорами), autodiff, компиляция, векторизация, параллелизация и шардирование, случайные числа (в функциональном программировании старые приёмы из NumPy не работают эффективно, зато теперь всё наглядно и воспроизводимо!) и pytrees.
Part 3: Ecosystem.
Большая глава с практическим знакомством с экосистемой высокоуровневых библиотек для DL (Flax, Optax, Orbax, CLU, …), а также примеры использования HuggingFace Transformers/Diffusers, которые давно уже добавили поддержку JAX. Также есть отдельная глава с очень верхнеуровневым и широким обзором того, что есть в JAX и вокруг за пределами нейросетевого мейнстрима.
Много крутых и умных людей читало и ревьюило мою книгу, спасибо куче GDE и не только. И отдельное спасибо Франсуа Шолле за добрые слова 🙂
“A comprehensive guide to mastering JAX, whether you’re a seasoned deep learning practitioner or just venturing into the realm of differentiable programming and large-scale numerical simulations.”
-- François Chollet, Software Engineer, Google
В общем это был прикольный опыт, я доволен результатом, надеюсь, вам тоже понравится.
Ещё отдельное спасибо всем, кто поддерживал GonzoML на Патреоне (https://www.patreon.com/GonzoML). Всем действующим платным членам нашей тесной группы я отправил коды для получения книги бесплатно (проверьте сообщения!) -- у вас будет постоянно обновляемая версия (a JAX очевидно будет меняться!) в онлайн доступе.
Manning Publications
Deep Learning with JAX - Grigory Sapunov
Accelerate deep learning and other number-intensive tasks with JAX, Google’s awesome high-performance numerical computing library.
Forwarded from Старший Авгур
https://huggingface.co/datasets/nyuuzyou/chatgpt-in-russia-qa
Оригинальный пост.
А что у нас тут? 600к вопросов (и ответов) с чатгпт-в-россии.рф!
Я, если честно, и не знал, что такой сайт существует.
Оригинальный пост.
А что у нас тут? 600к вопросов (и ответов) с чатгпт-в-россии.рф!
Я, если честно, и не знал, что такой сайт существует.
huggingface.co
nyuuzyou/chatgpt-in-russia-qa · Datasets at Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from CyberSecurityTechnologies (-CST-)
RAGent.pdf
1.1 MB
#tools
#Research
#Blue_Team_Techniques
"RAGent: Retrieval-based Access Control Policy Generation", 2024.
]-> https://github.com/accessframework/RAGent
#Research
#Blue_Team_Techniques
"RAGent: Retrieval-based Access Control Policy Generation", 2024.
]-> https://github.com/accessframework/RAGent
Forwarded from CyberSecurityTechnologies (-CST-)
RAG.pdf
4.2 MB
#Research
"Unleashing Worms and Extracting Data: Escalating the Outcome of Attacks against RAG-based Inference in Scale and Severity Using Jailbreaking", 2024.
"Unleashing Worms and Extracting Data: Escalating the Outcome of Attacks against RAG-based Inference in Scale and Severity Using Jailbreaking", 2024.
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
🎵 EZAudio - это новая модель преобразования текста в аудио (T2A).
Она устанавливает новый стандарт для моделей T2A с открытым исходным кодом b обеспечивает быструю, эффективную и реалистичную генерацию звуковых эффектов.
https://huggingface.co/spaces/OpenSound/EzAudio
@data_analysis_ml
Она устанавливает новый стандарт для моделей T2A с открытым исходным кодом b обеспечивает быструю, эффективную и реалистичную генерацию звуковых эффектов.
https://huggingface.co/spaces/OpenSound/EzAudio
@data_analysis_ml
Forwarded from NoML Digest (Pavel Snurnitsyn)
Про RL
Запись вчерашнего семинара скоро будет, а пока список литературы и материалов из доклада Сергея:
Книги:
▫️ R.S. Sutton, A.G. Barto, Reinforcement Learning, 2018, есть перевод (~550 стр.);
▫️ M. Lapan, Deep Reinforcement Learning Hands-On, 2020, есть перевод (~540 стр.);
▫️ L. Graesser, W.L. Keng, Foundations of Deep Reinforcement Learning, есть перевод (~410 стр.).
Вводная статья:
▫️ B. Jaeger, A. Geiger, An Invitation to Deep Reinforcement Learning, 2023 (38 стр.).
Курс:
▫️ Deep Reinforcement Learning Course.
Кейс команды GlowByte Advanced Analytics:
▫️ Как Reinforcement Learning помогает ритейлерам, 2020 (14 минут).
И еще пара статей:
▫️ Y. Lin et al., A Survey on Reinforcement Learning for Recommender Systems, 2021 (20 стр., ~1,5 часа);
▫️ F. Chen et al., BCRLSP: An Offline Reinforcement Learning Framework for Sequential Targeted Promotion, 2022 (7 стр., ~30-40 минут).
Запись вчерашнего семинара скоро будет, а пока список литературы и материалов из доклада Сергея:
Книги:
▫️ R.S. Sutton, A.G. Barto, Reinforcement Learning, 2018, есть перевод (~550 стр.);
▫️ M. Lapan, Deep Reinforcement Learning Hands-On, 2020, есть перевод (~540 стр.);
▫️ L. Graesser, W.L. Keng, Foundations of Deep Reinforcement Learning, есть перевод (~410 стр.).
Вводная статья:
▫️ B. Jaeger, A. Geiger, An Invitation to Deep Reinforcement Learning, 2023 (38 стр.).
Курс:
▫️ Deep Reinforcement Learning Course.
Кейс команды GlowByte Advanced Analytics:
▫️ Как Reinforcement Learning помогает ритейлерам, 2020 (14 минут).
И еще пара статей:
▫️ Y. Lin et al., A Survey on Reinforcement Learning for Recommender Systems, 2021 (20 стр., ~1,5 часа);
▫️ F. Chen et al., BCRLSP: An Offline Reinforcement Learning Framework for Sequential Targeted Promotion, 2022 (7 стр., ~30-40 минут).
Forwarded from DeepSchool
CVAT SDK PyTorch Adapter
Если вам надоело вручную выгружать задания от разметчиков и объединять их для загрузки на сервер, то эта статья для вас.
В новом материале обсудим:
- как загрузить данные из CVAT напрямую в torch.utils.data.Dataset;
- советы при работе с CVAT PyTorch SDK;
- недостатки SDK на данный момент.
Читайте новую статью по ссылке, чтобы готовить датасеты быстрее: https://deepschool-pro.notion.site/CVAT-SDK-PyTorch-Adapter-e223563927454322a8d56076e59b8b17
Если вам надоело вручную выгружать задания от разметчиков и объединять их для загрузки на сервер, то эта статья для вас.
В новом материале обсудим:
- как загрузить данные из CVAT напрямую в torch.utils.data.Dataset;
- советы при работе с CVAT PyTorch SDK;
- недостатки SDK на данный момент.
Читайте новую статью по ссылке, чтобы готовить датасеты быстрее: https://deepschool-pro.notion.site/CVAT-SDK-PyTorch-Adapter-e223563927454322a8d56076e59b8b17
Forwarded from Анализ данных (Data analysis)
DAG — это ориентированный ациклический граф, концептуальное представление серии действий или, другими словами, математическая абстракция конвейера данных (data pipeline).
▪ Github
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM