Анализ данных (Data analysis)

🍏

AIM: Autoregressive Image Models

Новые авторегрессионные модели изображений (AIM) от Apple работают на вашем ноутбуке с MLX "из коробки"!

▪Github
▪Paper

Пример на картинке.

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤6👍5🔥3

8.13K views06:01

Анализ данных (Data analysis)

🚀

Microsoft представляет DeepSpeed-FastGen

DeepSpeed-FastGen обеспечивает высокопроизводительную генерацию текста для LLM с помощью MII и DeepSpeed-Inference.

Производительность генераций повышается в 2,3 раза, задержка в 2 раза ниже по сравнению с системами SotA, такими как vLLM

▪Статья
▪Github

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤9👍5🔥3

8.74K views10:02

Анализ данных (Data analysis)

🧠

Новый бесплатный открытый курс по нейронауке для людей с бэкграундом в машинном обучении.

Хороший куря для углубления в вычислительную нейронауку.

Курс состоит из 34 коротких видеороликов, начиная с вводных тем и заканчивая недавними открытиями, которые мы до сих пор до не изучены.

Кроме того, в курсе есть практические упражнения в Google Colab.

▪Курс
▪Github
▪ Другие курсы DS 2024

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤16👍9🔥3

11.6K views11:23

Анализ данных (Data analysis)

🔥 Дайджест полезных материалов из мира Data Science за неделю

Почитать:
— Machine Learning инженер: что/где/как изучать, чтобы въехать
— Направо пойдёшь — тестировщиком станешь, налево пойдёшь — ˂...˃: куда податься питонисту?
— Инженерные данные в 21 веке
— 10 лучших скриптов Python для автоматизации и повышения производительности 2024 года.
— Spark не для чайников: где?
— OpenRefine и другие альтернативные MS Excel инструменты нормализации справочников для Экспертов НСИ
— Go — 100 вопросов/заданий с собеседований
— Уродливая математика в машинном обучении или чему нам стоит поучиться у деривативов?
— Best Web Scraping Libraries for Spring Boot
— Best Web Scraping Libraries for R
— How To Parse HTML With Regex
— Automatically Generating Data Exploration Code in Python With Mito
— Streamlit Authentication
— CanvasXpress vs. Plotly: Which Data Visualization Library Is Better?
— Working for a Data-Driven Startup Whose Value Surged 700% In Less Than One Year
— Check Out GomorraSQL — A Library To Write Queries in Neapolitan
— Achieving Loosely Coupling with a Math Expression Parser
— Returning CSV Content From an API in Spring Boot

Посмотреть:
🌐 #Python трюк сопоставления #программирование #код #питон #yotube #собеседование #алгоритмы (⏱ 00:59)
🌐 C# полный курс 2024. Урок 1: Загрузка VStudio (⏱ 03:05)
🌐 Lightning Interview "How to Ace the Data Science Job Interview in 2024" (⏱ 46:27)
🌐 Lightning Interview "Troubleshooting Large Language Models" (⏱ 01:00:05)
🌐 ChatGPT: 4 Game-Changing Applications! (⏱ 07:44)
🌐 NVIDIA Is Supercharging AI Research! (⏱ 07:39)

Хорошего дня!

@data_analysis_ml

👍15❤6🔥3

8.45K viewsedited 09:40

Анализ данных (Data analysis)

🎓

Представляем DataTrove .

DataTrove - это библиотека для обработки, фильтрации и дедупликации текстовых данных в очень больших масштабах. Она предоставляет набор готовых часто используемых функций обработки данных и фреймворк для простого добавления собственной функциональности.

Его конвейеры обработки не зависят от платформы и могут работать как локально, так и на кластере slurm.

Низкое потребление памяти и удобная конструкция делают его идеальным для больших рабочих нагрузок, например для обработки обучающих данных LLM. ✨

git clone [email protected]:huggingface/datatrove.git && cd datatrove
pip install -e ".[FLAVOUR]

▪Github
▪Примеры

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤7🔥4🥰2

8.36K views08:10

Анализ данных (Data analysis)

☑

Вышел Scikit-learn 1.4.0

🟢 5 новых крупных новых функкций и 13 небольших новых фич
🔵 14 улучшений производительности
🟡 15 изменений в API
🔴 38 исправленных багов

https://scikit-learn.org/stable/whats_new/v1.4.html#changes-1-4

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤23👍9🔥7

8.03K views09:00

Анализ данных (Data analysis)

⚡️

Lazy Predict позволяет быстро создавать прототипы для анализа данных и сравнивать несколько базовых моделей без необходимости вручную писать код или настраивать параметры.

Это помогает специалистам по исследованию данных выявлять перспективные подходы в работе с даныыми и быстрее реализовывать модели.

pip install lazypredict

▪Github

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤27👍10🔥7

8.65K views06:02

Анализ данных (Data analysis)

0:28

This media is not supported in your browser

VIEW IN TELEGRAM

⚡️ По мере того как усиливается гонка за создание первого в мире по-настоящему полезного квантового компьютера, растет и потребность в ясном взгляде на вещи.

В этом выпуске программы "Полевые заметки" мы погрузимся глубже. в Google Quantum AI, чтобы понять реальность квантовых вычислений и их влияние на мир.

▪Видео
▪Почитать

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

👍12❤4❤‍🔥1🔥1🤣1

8.41K views14:03

Анализ данных (Data analysis)

🌟 При работе с файлами Parquet в pandas обычно сначала загружают данные в pandas DataFrame, а затем применяют фильтры.

Чтобы увеличить скорость выполнения запросов, переместите фильтры в движок PyArrow и воспользуйтесь оптимизацией обработки PyArrow.

@data_analysis_ml

👍36🔥10❤5

8.47K views10:31

Анализ данных (Data analysis)

🚀 Одна из распространенных привычек Pandas, от которой полезно отказаться в Polars:

В Pandas датасаентисты часто добавляют/преобразуют столбцы в отдельных строках.

В Polars наоборот удобно добавляют много выражений в однну функцию with_columns.

Почему?

Ответ в производительности. Потому что Polars может выполнять все выражения параллельно.

@data_analysis_ml

👍21❤13🔥11

8.03K views06:02

Анализ данных (Data analysis)

🚀 LLMLingua: Enhancing Large Language Model Inference via Prompt Compression

LLMLingua использует компактную, хорошо обученную языковую модель (например, LaMA-7B) для поиска и удаления несущественных лексем в промптах.

Этот подход обеспечивает эффективный вывод с использованием больших языковых моделей (LLM), достигая 20-кратного сжатия при минимальной потере качества генерации.

▪Github
▪Документация

@data_analysis_ml

👍12❤5🔥1

9.8K views07:33

Анализ данных (Data analysis)

⚡ RoMa: простая в использовании, стабильная и эффективная библиотека для работы с кватернионами, векторами вращения, пространственными преобразованиями в PyTorch.

pip install roma

▪Github
▪Docs

@data_analysis_ml

❤11👍6🔥1

8.8K views15:31

Анализ данных (Data analysis)

🎮

Build a Large Language Model (From Scratch)

Еще один замечательный ресурс, который подходит для начинающих, чтобы построить ChatGPT-подобный LLM с нуля, шаг за шагом

▪Github

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

👍22🤯3❤1🥰1🎉1

9.95K views08:03

Анализ данных (Data analysis)

🖥

Google-Colab-Selenium

Лучший способ использовать Selenium в блокнотах Google Colab!

▪Простая настройка Selenium и ChromeDriver.
▪Бесшовная интеграция с Google Colab.
▪Поддержка ChromeDriver для сложных случаев парсинга.

%pip install google-colab-selenium

import google_colab_selenium as gs
from selenium.webdriver.chrome.options import Options

# Instantiate options
options = Options()

# Add extra options
options.add_argument("--window-size=1920,1080")  # Set the window size
options.add_argument("--disable-infobars")  # Disable the infobars
options.add_argument("--disable-popup-blocking")  # Disable pop-ups
options.add_argument("--ignore-certificate-errors")  # Ignore certificate errors
options.add_argument("--incognito")  # Use Chrome in incognito mode


driver = gs.Chrome(options=options)

driver.get('https://uproger.com')
print(driver.title)
driver.quit()

➡️

Github

➡️

Colab

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

👍15🔥8❤3🥰2

9.25K views07:26

Анализ данных (Data analysis)

🖥 SQL-metadata

Если вы хотите извлечь определенные компоненты #SQL-запроса для последующей работы с нмим на #Python, используйте sql_metdata.

Извлекает имена столбцов и таблиц, используемых в запросе. Автоматически выполняет разрешение псевдонимов столбцов, разрешение псевдонимов подзапросов, а также разрешение псевдонимов таблиц.

Также предоставляет полезные функции для нормализации SQL-запросов.

pip install sql-metadata

▪Github
▪Docs

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

👍13❤5🔥3

8.41K viewsedited 13:02

Анализ данных (Data analysis)

🖥

Nxs-data-anonymizer - это инструмент для анонимизации дампа баз данных

PostgreSQL и MySQL/MariaDB/Percona.

▪Поддерживаемые базы данных и версии:
PostgreSQL (9/10/11/12/13/14/15/все версии)
MySQL/MariaDB/Percona (5.7/8.0/8.1/все версии)

▪Гибкая генерация фейковых данных на основе шаблонов Go и библиотеки шаблонов Sprig.

▪Потоковая обработка данных. Это означает, что вы можете перенаправлять дамп из исходной БД в любую другую БД с преобразованиями

▪Легко интегрируется в CI/CD

➡️

Github

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

👍9❤2🔥1

8.86K views09:02

About

Blog

Apps

Platform