Анализ данных (Data analysis)
46.3K subscribers
2.31K photos
264 videos
1 file
2.04K links
Data science, наука о данных.

@haarrp - админ

@itchannels_telegram - 🔥 главное в ит

@ai_machinelearning_big_data - ML

@machinelearning_interview - вопросы с собесдований по Ml

РКН: clck.ru/3FmyAp
Download Telegram
🌟 σ-GPT — новый взгляд на авторегрессионные модели

GPT генерируют последовательности в порядке слева направо. Возможно ли по-другому?
Arnaud Pannatier и его коллеги разработали σ-GPT, способный генерировать последовательности в любом порядке, динамически выбираемом во время вывода.

🟡 Arxiv
🖥 GitHub

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍146🔥4😍1
🌟 DataComp-LM — комплексный фреймворк, предназначенный для построения и обучения LLM на различных наборах данных

DataComp-LM предлагает стандартизированный набор из более чем 300Т нефильтрованных лексем из CommonCrawl, эффективные рецепты предварительного обучения на основе фреймворка open_lm и большой набор из более чем 50 бенчмарков.

DCLM позволяет исследователям экспериментировать с различными стратегиями построения наборов данных в различных вычислительных масштабах, от 411M до 7B моделей с параметрами.

🖥 GitHub
🟡 Arxiv

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍96🔥3
🖥 Mesop — Python фреймворк для быстрого создания UI для LLM-приложений и не только

Особенности Mesop:
— UI пишется очень идиоматично и лаконично
— масса готовых компонентов, просто plug-and-play
— поддержка горячей перезагрузки, когда браузер сам обновляет UI по мере написания; при этом сохраняется состояние
— можно работать с готовым UI как с простым наборов функций Python

🖥 GitHub

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15🔥54🥰1
🌟 Создание text-to-SQL системы с Mistral AI, Neon, и LangChain

Если использовать просто LLM для генерации SQL, то может получиться синтаксически неверный SQL, усугубляет ситуацию и масса диалектов SQL в разных БД.
К тому же LLM не имеет доступа к полной схеме базы данных, именам таблиц и столбцов, а также индексам, что ограничивает его возможности по созданию точных/эффективных запросов. А передавать полную схему в промпте каждый раз дорого и неудобно.

Ок, но ведь LLM отлично обучаются в контексте, поэтому, передавая релевантную информацию в промпте, можно улучшить их результаты — так мы приходим к RAG.
И здесь по ссылке ниже разбирается построение системы RAG с использованием Mistral AI, Neon Postgres как векторной БД, и LangChain, чтобы связать всё это вместе.

🟡 Создание Text-to-SQL системы

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥127👍4
🌟 4M: Massively Multimodal Masked Modeling

4M-21 — open-source фреймворк от Apple для обучения мультимодальных моделей и решения множества задач

Из-за CVPR релиз 4M-21 прошёл незаметно, а ведь фреймворк очень функциональный.

4M-21 позволяет обучать универсальные мультимодальные модели, способные выполнять разные задачи, связанные с CV.
4M-21 позволяет:
— создавать подписи к изображениям
— оценивать глубину
— обнаруживать объекты на изображении
— делать сегментацию объектов
— генерировать изображения
— и решать много других задач

🟡 Страничка 4M-21
🖥 GitHub
🟡 Arxiv
🟡 Hugging Face

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍76🔥3
⚡️ Cognitive Computations выпустиили dolphin-2.9.3-mistral-7B-32k

В 2.9.3 включен многоязычный SystemChat 2.0 - 100 языков!

Отличная базовая модель!

https://huggingface.co/cognitivecomputations/dolphin-2.9.3-mistral-7B-32k

@data_analysis_ml
🔥8👍43🥰3
🌟 Enzyme — высокопроизводительное автоматическое дифференцирование LLVM и MLIR

brew install enzyme

Enzyme — это инструмент, который принимает произвольный код в виде LLVM IR и вычисляет производную (и градиент) этой функции.
Это позволяет использовать Enzyme для автоматического создания градиентов своего исходного кода без лишней работы. Работая на уровне LLVM, Enzyme может дифференцировать программы на разных языках (C, C++, Swift, Julia, Rust, Fortran, TensorFlow и т. д.) с высокой производительностью.

🖥 GitHub
🟡 Доки

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
6👍6🔥2
🌟 Evidently — фреймворк Python для оценки, тестирования и мониторинга ML-моделей в продакшене

pip install evidently

Evidently помогает оценивать, тестировать и контролировать данные и ML-системы.
Вот некоторые из решаемых Evidently задач:

— прогностические: классификация, регрессия, ранжирование, рекомендации

— генеративные: чат-боты, RAGs, вопросно-ответные системы

— мониторинг данных: качество данных и дрейф данных для текстовых, табличных данных

🖥 GitHub
🟡 Доки

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍134🔥4
⚡️ OlympicArena — бенчмарк для оценки способностей LLM решать олимпийские задачи

OlympicArena — это комплексный бенчмарк со сложным механизмом оценки LLM, предназначенный для определения возможностей AI в широком спектре задач олимпийского уровня.

🖥 GitHub
🟡 Страничка OlympicArena

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍64🔥2😱1
🌟 DeepSeek-Coder-V2-Instruct-GGUF — квантизованные версии DeepSeek-Coder-V2-Instruct

pip install -U "huggingface_hub[cli]"
huggingface-cli download bartowski/DeepSeek-Coder-V2-Instruct-GGUF --include "DeepSeek-Coder-V2-Instruct-Q4_K_M.gguf" --local-dir ./


Представлены несколько моделей с разным уровнем сжатия, требуют от 142.45 Гб до 52.7 Гб (но последняя не рекомендуется, экстремально низкое качество)

Квантизация выполнена с использованием опции imatrix, с использованием датасета отсюда
Исходная, не квантизованная модель


🤗 Hugging Face

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍94🔥2