Data Analysis / Big Data – Telegram

Data Analysis / Big Data

@big_data_analysis

2.84K subscribers

573 photos

4 videos

2 files

2.76K links

Лучшие посты по анализу данных и работе с Big Data на русском и английском языке

Разместить рекламу: @tproger_sales_bot

Правила общения: https://tprg.ru/rules

Другие каналы: @tproger_channels

Download Telegram

About

Blog

Apps

Platform

Data Analysis / Big Data

2.84K subscribers

Data Analysis / Big Data

Как MLOps помогает обеспечить гибкость машинного обучения и стимулирует инновации

Многие компании внедряли машинное обучение рывками, приобретая и разрабатывая модели, алгоритмы, инструменты и сервисы под конкретные задачи. Этот подход неизбежен на старте, когда бизнес только узнает о возможностях технологий. Но в результате получается сборная солянка из изолированных, запускаемых вручную, нестандартизированных процессов и компонентов. Как следствие, появляются неэффективные громоздкие сервисы, которые приносят меньше пользы, чем могли бы, или полностью блокируют дальнейшее развитие.

Команда VK Cloud перевела статью о значимости стандартизации и автоматизации ML-процессов и как с этим поможет подход MLOps.

Читать: https://habr.com/ru/post/713182/

645 views08:11

Data Analysis / Big Data

Дайджест Python #3: пишем AI-плеер для сайта и боремся с лесными пожарами

Собрали лучшие материалы по Python с 1 по 14 февраля: как создать ИИ-плеер, как предсказать лесные пожары и как быстро прокачать код.

Читать: «Дайджест Python #3: пишем AI-плеер для сайта и боремся с лесными пожарами»

551 views09:29

Data Analysis / Big Data

Подборка актуальных вакансий

— Главный разработчик
Где: Москва, можно удалённо
Опыт: от 3 лет

— Middle DevOps Engineer
Где: Москва, можно удалённо
Опыт: без опыта

— Разработчик 1С
Где: Москва, Санкт-Петербург, Ростов-на-Дону
Опыт: от 3 лет

— Ведущий системный аналитик
Где: Москва, можно удалённо
Опыт: от 3 лет

— Руководитель команды NoSQL
Где: Москва, можно удалённо
Опыт: от 3 лет

— Auto QA-инженер
Где: Москва, можно удалённо
Опыт: от 1 года

— Senior Android Developer
Где: Москва, можно удалённо
Опыт: от 3 лет

— Senior iOS Developer
Где: Москва, можно удалённо
Опыт: от 3 лет

— Hadoop администратор
Где: Москва, можно удалённо
Опыт: от 1 до 3 лет

— Data Engineer
Где: Москва, можно удалённо
Опыт: можно без опыта

#вакансии #работа

619 views10:02

Data Analysis / Big Data

Дайджест Python #3: пишем AI-плеер для сайта и боремся с лесными пожарами

Собрали лучшие материалы по Python с 1 по 14 февраля: как создать ИИ-плеер, как предсказать лесные пожары и как быстро прокачать код.

Читать: «Дайджест Python #3: пишем AI-плеер для сайта и боремся с лесными пожарами»

625 views10:16

Data Analysis / Big Data

Visualize Oracle Analytics Cloud data using Power BI

Is Microsoft Power BI your tool of choice for visualizing data? If so, now you can use it to visualize data in Oracle Analytics Cloud (OAC) through the power of the OAC semantic layer.

Read: https://blogs.oracle.com/analytics/post/visualize-oracle-analytics-cloud-data-using-power-bi

Visualize Oracle Analytics Cloud Data Using Power BI

Is Power BI your tool of choice for visualizing data? If so, you can visualize data provided by Oracle Analytics Cloud (OAC) through the power of the OAC semantic layer.

628 views22:12

Data Analysis / Big Data

Pathway: unlocking data stream processing [Part 1] - real-time linear regression

Read: https://www.dataengineeringweekly.com/p/pathway-unlocking-data-stream-processing

639 views04:06

Data Analysis / Big Data

Как Homebrew раздаёт 52 миллиона пакетов в месяц?

Пакетный менеджер Homebrew раздаёт 52 миллиона пакетов в месяц. Чтобы это делать, он использует хранилища контейнеров, отлично подходящие для этой задачи. Как это работает?

Читать: https://habr.com/ru/post/717400/

676 views13:34

Data Analysis / Big Data

Как мы распараллелили CatBoost на Spark

Привет, Хабр! Я занимаюсь инженерией данных в Х5 Tech. В этой статье я решил поделиться проблемами, с которыми столкнулись при распараллеливании CatBoost на Spark, и как мы нашли решение. Возможно, это не rocket science, но если бы со мной поделились такими ответами заранее, я бы сэкономил себе пару вечеров свободного времени.

Читать: https://habr.com/ru/post/717450/

713 views14:52

Data Analysis / Big Data

7 способов улучшения датасетов медицинских снимков для машинного обучения

Качество датасета медицинских снимков (как и датасетов изображений в любой другой области) напрямую влияет на точность модели машинного обучения.

В секторе здравоохранения это ещё более важно, ведь качество крупных массивов данных медицинских снимков для диагностического и медицинского AI (искусственного интеллекта) или моделей глубокого обучения может стать для пациентов вопросом жизни и смерти.

Как знают команды клинических исследователей, сложность, форматы и слои информации в медицине больше и затейливее, чем в немедицинских изображениях и видео. Отсюда и берётся необходимость в алгоритмах искусственного интеллекта, машинного обучения (ML) и глубокого обучения с целью понимания, интерпретации и обучения на аннотированных массивах данных медицинских снимков.

В этой статье мы расскажем о сложностях создания обучающих массивов данных из медицинских снимков и видео (особенно в сфере радиологии), а также поделимся рекомендациями по созданию обучающих массивов данных высочайшего качества.

Читать: https://habr.com/ru/post/704192/

718 views12:15

Data Analysis / Big Data

When you don't need data

Read: https://junkcharts.typepad.com/numbersruleyourworld/2023/02/when-you-dont-need-data.html

655 views20:02

Data Analysis / Big Data

У нас для вас отличные новости! Наш сайт обновился и теперь может уведомлять по почте и в Telegram о новых материалах, которые интересны именно вам

Для этого вам нужно:

1. Авторизоваться на сайте tproger.ru
2. Зайти в свой профиль и подписаться на интересные вам теги в разделе «Подписки». Например, библиотеки, инструменты и другие
3. В разделе уведомлений выбрать, как именно вы хотите получать уведомления
4. Всё! Вы великолепны и теперь всегда будете первым узнавать о свежих материалах

👍3

703 views11:03

Data Analysis / Big Data

Data Pipeline Design Patterns - #2. Coding patterns in Python

Read: https://www.startdataengineering.com/post/code-patterns/

699 views17:07

Data Analysis / Big Data

Большие данные в строительстве

Строительная отрасль генерирует огромное количество данных, которые во всей их совокупности системно не используют в полном объеме для извлечения потенциально ценной информации. Причиной является конфликт между практикой взаимодействия субъектов строительства и BIM-технологией для проектирования объектов. Иная структура САПР в строительстве позволит собирать данные не конфликтуя со сложившимися отношениями.

Читать: https://habr.com/ru/post/717840/

734 views08:47

Data Analysis / Big Data

Data Engineering Weekly #119

Read: https://www.dataengineeringweekly.com/p/data-engineering-weekly-119

659 views04:13

Data Analysis / Big Data

Введение в Adversarial attacks: как защититься от атак в модели глубокого обучения на транзакционных данных

Машинное обучение широко применяется в различных отраслях. Последние несколько лет все большее распространение получают модели глубокого обучения, включая финансовую и банковскую сферы. В тоже время существуют риски, связанные с манипуляциями ограничений данного рода решений. В частности, риск подвергнуться намеренной атаки на такие модели. В этой статье представим общую таксономию таких атак и способов защиты от них. А также частный случай возможных атак на модели глубокого обучения на транзакционных данных и защиты от таких атак.

Adversarial attacks - это злонамеренное манипулирование входными данными модели машинного обучения с целью заставить ее выдать неправильные предсказания.

Эти атаки проектируются, чтобы использовать уязвимости алгоритмов машинного обучения и часто могут быть выполнены незаметно для системы или пользователя.

Цели таких атак могут варьироваться от причинения финансовых убытков, кражи конфиденциальной информации до нарушения работы системы в целом.

Виды атак

Существует несколько типов Adversarial attacks, каждый из которых имеет свои уникальные характеристики и методологию.

Читать: https://habr.com/ru/post/718024/

769 views10:31

Data Analysis / Big Data

Неудачный опыт: выявление аномалий в данных методами кластеризации

Неудачный опыт: выявление аномалии в новостных данных методами кластеризации

Читать: https://habr.com/ru/post/718108/

743 views13:09

Data Analysis / Big Data

Покупка гаража как инвестиция

Этот проект родился после беседы с друзьями об инвестициях в недвижимость. Обсуждали, как выгодно купить квартиру, паркинг или келлер под сдачу и выгодно ли вообще.

Я решил проанализировать рынок продажи и аренды гаражей и парковочных мест своего города. Квартиры – слишком дорогие объекты для инвестиций, а что касается гаражей и паркингов – тут «вход» гораздо меньше, и на аренду вроде бы всегда есть спрос.

Читать: https://habr.com/ru/post/718192/

826 views22:29

Data Analysis / Big Data

Подкаст «Хочу в Геймдев» #48: Профессия DataScientist

Вот и наш уже 48й подкаст «Хочу в Геймдев», посвященный профессиям в сфере разработки игр!

В этот раз мы выбрали важную в современных реалиях профессию, о которой мало говорят: Data Scientist, по мнению руководителя образовательных программ “Менеджмент игровых проектов” Вячеслава Уточкина, тема искусственного интеллекта поднимается не только на частных и коммерческих уровнях, но и на государственных.

Читать: https://habr.com/ru/post/718406/

773 views16:04

Data Analysis / Big Data

“Топ 10” популярных мужских профессий в столице и регионах в 2023 году

Мир не стоит на месте. На смену многим мужским профессиям, что были актуальны полвека назад, приходят новые и более современные. Если раньше нас сковывали рамки малоразвитых технологий и выбор будущей профессии был невероятно мал, то сейчас есть где разгуляться. В преддверии праздника всех мужчин я задумался, а какие профессии, мы мужчины 2023 года, выбираем. Как известно, столица всегда отличалась от периферии и уровнем развития, и доходом, и мне стало интересно, чем наш выбор в данных городах отличается. Отслеживать резюме я решил на сервисе по поиску работы, из столичных городов взял Москву и Санкт-Петербург, в регионе Тверь и Иваново. Анализ я провел в программе PolyAnalyst, загрузив туда данные из резюме. На первом этапе я выделил самые популярные профессии в Москве и Санкт-Петербурге, ими стали водитель, менеджер, инженер, специалист, кладовщик, юрист, администратор, шеф-повар, управляющий и замыкает десятку профессия начальник участка.

Читать: https://habr.com/ru/post/718538/

755 views09:30

Data Analysis / Big Data

Clickhouse: сжимаем данные эффективно

В этой статье мы разберем один из способов оптимизации хранения данных и запросов, который поможет ускорить процесс выполнения задачи с помощью использования кодеков сжатия в колонках. И протестируем какие результаты можно получить при использовании кодеков.

Читать: https://habr.com/ru/post/718618/

683 views14:27