Data Analysis / Big Data – Telegram

Data Analysis / Big Data

@big_data_analysis

2.83K subscribers

568 photos

4 videos

2 files

2.85K links

Лучшие посты по анализу данных и работе с Big Data на русском и английском языке

Разместить рекламу: @tproger_sales_bot

Правила общения: https://tprg.ru/rules

Другие каналы: @tproger_channels

Download Telegram

About

Blog

Apps

Platform

Data Analysis / Big Data

2.83K subscribers

Data Analysis / Big Data

Автопереобучение моделей в Production

Модели машинного обучения становятся критически важными для бизнеса, помогая оптимизировать процессы и принимать более обоснованные решения. Однако их актуальность и точность могут быстро снижаться из-за изменения данных. Автоматическое переобучение моделей в продакшене решает эту проблему, обеспечивая обновление и улучшение моделей без значительных временных затрат.

В этой статье мы рассмотрим процесс автоматического переобучения моделей ML в продакшене, используя инструменты MLOps. Обсудим интеграцию таких инструментов, как AirFlow и Spark, с CI/CD пайплайнами, а также создание конфигурационного модуля, позволяющего разработчикам сосредоточиться на моделях, не углубляясь в инфраструктурные детали.

Читать: https://habr.com/ru/companies/alfa/articles/821447/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

556 views15:57

Data Analysis / Big Data

Data Engineering Project for Beginners - Batch edition

Read: https://www.startdataengineering.com/post/data-engineering-project-for-beginners-batch-edition/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

660 views22:21

Data Analysis / Big Data

Лучшие библиотеки Python для Data Science в 2024 году

Python — один из самых распространенных языков программирования в Data Science (третье место в опросе разработчиков StackOverflow). Популярность языка обусловлена наличием множества пакетов, которые можно использовать для решения различных задач в области науки о данных, включая машинное обучение, предварительную обработку данных, анализ данных и их визуализацию.

Новичку в этой области может быть сложно понять, с чего начать, особенно при таком обилии ресурсов — в Python имеется более 100 000 встроенных библиотек, и выучить их все просто невозможно. Именно поэтому в этой статье мы рассмотрим 8 самых полезных библиотек Python для Data Science.

Читать: https://habr.com/ru/companies/productstar/articles/821847/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

591 views12:43

Data Analysis / Big Data

OCI AI Vision Facial Detection in Oracle Analytics Cloud

This post explores the OCI service AI Vision Facial Detection exposed directly in Oracle Analytics. With prebuilt models available, developers can easily build image recognition and text recognition into their applications without machine learning (ML) expertise. This post will walk users through registering their AI Vision Face Detection model, uploading images, running their dataflow, and analyzing the output.

Read: https://blogs.oracle.com/analytics/post/ai-vision-facial-detection-in-oac

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

568 views21:59

Data Analysis / Big Data

Краеугольные камни ClickHouse

Привет, Хабр! Меня зовут Артемий Кравцов, я работаю инженером в Wildberries. Сегодня расскажу про то, что люблю – про ClickHouse. Моя цель – осветить некоторые ключевые особенности в архитектуре ClickHouse и в том, как он хранит данные.

Что такое куски и слияния? Как быть с частыми вставками? Как обновлять значения в строках? Что не так с точечными чтениями? Как сделать тяжёлый JOIN?

Статья рассчитана на тех, кто только знакомится с ClickHouse.

Читать: https://habr.com/ru/companies/wildberries/articles/821865/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

577 views09:17

Data Analysis / Big Data

Data Engineering Projects

Read: https://www.startdataengineering.com/post/data-engineering-projects/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

656 views17:54

Data Analysis / Big Data

Интеграция LLM в корпоративное хранилище данных

В данной статье рассматриваются способы интеграции Large Language Models (LLM) в корпоративные системы хранения данных. Основное внимание уделено использованию LLM для автоматического извлечения информации из текстовых данных с последующим формированием SQL-запросов. В рамках исследования также изучаются методы пост-обработки результатов SQL-запросов с целью улучшения точности и адаптивности моделей к конкретным характеристикам и особенностям баз данных.

Работа включает в себя анализ существующих решений и методов оценки эффективности LLM в контексте их интеграции в корпоративные информационные системы. Особое внимание уделяется применению Preference Learning via Database Feedback — подхода, направленного на обучение моделей на основе обратной связи от баз данных, что способствует более точному и адаптивному выполнению запросов пользователей.

Исследование также охватывает разработку примеров интеграции LLM в реальные корпоративные хранилища данных с целью демонстрации практической применимости и эффективности предлагаемых подходов.

Читать: https://habr.com/ru/articles/822771/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

611 views16:20

Data Analysis / Big Data

Повышаем Data Quality: щепотка Soda для ваших данных

Привет! Меня зовут Александр Кудрявцев, я аналитик данных в команде Data Platform Банки.ру. Недавно мы озадачились вопросом контроля качества данных (Data Quality) и стали искать комплексное решение. Один из инструментов, который попал в поле зрения, — Soda Core. О нем и пойдет речь в материале.

Читать: https://habr.com/ru/companies/banki/articles/822601/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

542 views07:42

Data Analysis / Big Data

Building Models with OML4R and Deploying them in Oracle Analytics Cloud

Oracle Analytics Cloud (OAC) offers various approaches to integrate machine learning models, ensuring flexibility and efficiency in your data analysis processes. This article guides you through using Oracle Machine Learning for R (OML4R) to train and test models in the database and deploy them in OAC.

Read: https://blogs.oracle.com/analytics/post/building-oracle-machine-learning-models-with-oml4r-and-deploying-in-oracle-analytics-cloud

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

Building Oracle Machine Learning Models with OML4R and Deploying in Oracle Analytics Cloud

Oracle Analytics Cloud (OAC) offers various approaches to integrate machine learning models, ensuring flexibility and efficiency in your data analysis processes. This article guides you through using Oracle Machine Learning for R (OML4R) to train and test…

501 views09:59

Data Analysis / Big Data

Use Custom Hostnames for Oracle Fusion Analytics

Custom hostnames for Oracle Fusion Analytics series overview.

Read: https://blogs.oracle.com/analytics/post/use-custom-hostnames-for-oracle-fusion-analytics

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

442 views09:59

Data Analysis / Big Data

Get Started with Oracle Analytics Cloud APIs

Learn how to use the OAC Public REST APIs with a Postman Collection.

Read: https://blogs.oracle.com/analytics/post/get-started-with-oracle-analytics-cloud-apis

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

Get Started with Oracle Analytics Cloud APIs

Learn how to use the OAC Public REST APIs with a Postman Collection.

547 views09:59

Data Analysis / Big Data

Внедрение Business Intelligence с нуля — первые шаги

Внедрение системы Business Intelligence в рамках компании - одновременно уникально для каждой компании, и в то же время может быть унифицировано за счет использования существующего опыта и знаний. В этой статье приведены базовые принципы построения BI систем, на которые можно ориентироваться, чтобы сэкономить время и получить качественную BI систему для компании. Тем, кому интересны основы BI систем - добро пожаловать :)

В качестве небольшого вступления имеет смысл отметить две особенности BI систем. BI системы основаны на рассчитываемых ключевых показателях эффективности (KPI), но тем не менее, для управления компанией представляет ценность именно система или набор показателей, а не какой-либо единственный показатель. Другой особенностью является то, что BI система аккумулирует данные из различных систем и различной периодичностью, например, финансовые показатели из учетных систем, данные о клиентах из CRM систем или из систем обратной связи с клиентами, и все эти задачи интеграции встают перед компанией, которая внедряет BI.

Рассморим выбор ключевых показателей BI системы "с нуля", что определит суть будущей BI системы компании. Конечно, можно использовать и готовый набор показателей, которые часто имеются для разных предметных областей в различных BI платформах, в этой статье обращается внимание на выбор системы KPI "с нуля".

Популярным подходом к управлению по KPI является сбалансированная система показателей (Balances Scorecards, BCS), предложенная Р. Капланом и Д. Нортоном "Сбалансированная система показателей" в 1996 году. В книге рекомендуется подход к управлению, основанный на ключевых показателях эффективности (KPI), отслеживающих стратегический прогресс в достижении основных целей по четырем направлениям: финансовые показатели, взаимодействие с клиентами компании, внутренние процессы компании и обучение/рост сотрудников компании.

Читать: https://habr.com/ru/articles/824268/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

👍3

473 views05:14

Data Analysis / Big Data

Почему Starburst Icehouse подходит не всем

Недавно CEO Starburst опубликовал манифест о будущем открытого озера данных. В манифесте он говорит об Icehouse, архитектуре озера данных нового поколения на базе Trino и Iceberg. Глядя на нее, многие разработчики недоумевали: «А чем она отличается от любой другой архитектуры Data Lakehouse?». Команда VK Cloud перевела статью о концепции Icehouse. Вы поймете, почему в ней нет необходимости и почему она подходит далеко не всем, кто работает с открытыми архитектурами озера данных.

Читать: https://habr.com/ru/companies/vk/articles/824258/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

495 views13:30

Data Analysis / Big Data

Почему стоит использовать Apache Airflow?

Apache Airflow — это мощный инструмент для управления сложными данными. Он позволяет удобно планировать задачи, упорядочивать их выполненеие и анализировать результаты с помощью визуального интерфейса. Узнайте больше о фичах, которые помогут эффективно управлять данными!

Читать подробнее
___
Другие наши проекты

👍1

593 views21:28

Data Analysis / Big Data

Создание и обработка Excel файлов с использованием Python

Всем привет! Работа с Excel файлами — одна из частых задач, встречающихся в повседневной разработке. В этой статье рассмотрим, как с помощью Python можно создавать, заполнять, и стилизовать Excel файлы. Для этого мы будем использовать библиотеки pandas, openpyxl и faker (для тестов).

Читать: https://habr.com/ru/articles/824050/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

525 views03:42

Data Analysis / Big Data

strtree — классификатор строк на основе регулярных выражений

Вы хотите найти короткие регулярные выражения, полно и точно отделяющие один класс строк от другого? Это статья для вас. Мы поговорим про задачу классификации строк с помощью автоматически определяемых паттернов, а в конце я предоставлю пример такой процедуры с кодом на Python. Пользоваться мы будем небольшой open-source библиотекой strtree.

Читать: https://habr.com/ru/articles/824544/

@big_data_analysis
___
Другие наши проекты | Чата аналитиков данных

541 views05:20

Data Analysis / Big Data

Восстановление после сбоев Oracle Analytics Server на Oracle Cloud

В статье обсуждается использование инструмента OCI Full Stack Disaster Recovery для обеспечения непрерывной работы Oracle Analytics Server в облаке Oracle. Решение позволяет быстро восстановить данные и минимизировать потери при сбоях.

Читать подробнее
___
Другие наши проекты

Disaster Recovery of Oracle Analytics Server on Oracle Cloud using OCI Full Stack Disaster Recovery

460 views20:58

Data Analysis / Big Data

Как создать отчет о разрешениях каталога в Oracle Analytics Cloud с помощью REST API

Узнайте, как с помощью REST API создать детальный отчет о разрешениях каталога в Oracle Analytics Cloud. Статья объясняет все шаги, начиная с подключения к API и заканчивая анализом полученных данных.

Читать подробнее
___
Другие наши проекты

How to Create a Catalog Permissions Report in Oracle Analytics Cloud using REST APIs

497 views20:58

Data Analysis / Big Data

Oracle Analytics признан лидером 2024 года!

Поздравляем сообщество Oracle Analytics с достижением значительного успеха. Благодаря их усилиям Oracle Analytics был признан лидером в Magic Quadrant от Gartner по аналитике и бизнес-интеллекту за 2024 год.

Читать подробнее
___
Другие наши проекты

Oracle Analytics Named a Leader in the 2024 Gartner® Magic Quadrant™ for Analytics & Business Intelligence Platforms

Congratulations to the Oracle Analytics community on their analytics leadership, which has helped Oracle Analytics become a leader in the Gartner ABI Magic Quadrant.

588 views20:59

Data Analysis / Big Data

Ускорение Python в 2 раза с помощью multiprocessing, async и MapReduce

Python действительно может считаться относительно медленным языком программирования по сравнению с некоторыми другими языками, такими как C++ или Java. Однако, существуют различные библиотеки и инструменты, которые позволяют ускорить выполнение счетных задач в Python. Рассмотрим как можно ускорить анализ данных в 2 раза!

Читать: https://habr.com/ru/articles/825206/

@big_data_analysis
___
Другие наши проекты | Чат аналитиков данных

739 views20:53