Data Analysis / Big Data

Эспоо внедряет Oracle Cloud Applications и Fusion Data Intelligence для оптимизации финансового управления. Этот шаг помогает городу стать международно связанным и инновационным лидером в сфере цифровых технологий. Подробнее об инициативе и её перспективах.

Читать подробнее

#en

@big_data_analysis | Другие наши каналы

Oracle

Espoo – a city with ambition to be a digital leader

The City of Espoo adopts Oracle Cloud Applications and Fusion Data Intelligence for financial management in support of its desire to be an internationally connected pioneer city.

278 views01:43

Data Analysis / Big Data

«Таргетинг Портал»: как мы сделали рекламные кампании проще и эффективнее

Привет, Habr! Меня зовут Катя, я продакт-менеджер BigData в «Группе Лента» и отвечаю за развитие цифровых продуктов в направлении монетизации данных. В статье расскажу, как нам удалось уйти от Excel-файлов и ручного согласования сегментов к автоматизированному порталу, с помощью которого рекламные агентства теперь сами собирают нужные им сегменты и выгружают их в MyTarget.

Читать: https://habr.com/ru/companies/lentatech/articles/943756/

#ru

@big_data_analysis | Другие наши каналы

265 views10:48

Data Analysis / Big Data

Как вытащить EdTech-компанию из кризиса за счет ИИ в IT-инфраструктуре

Привет, Хабр! Наверняка вы помните успех онлайн-школ во время пандемии — тогда каждый или кого-то учил, или чему-то учился. Однако за пять лет технологии шагнули вперед, а EdTech остался на том же уровне — и это привело к упадку. Зачем платить за курс, если нейросеть может научить чему угодно бесплатно (хоть к качеству обучения и возникают очевидные вопросики)?

В онлайн-школе IBLS смогли превратить ML из конкурента в союзника, и с его помощью осовременить процесс обучения для всех участников. Как это получилось — рассказываю под катом.

Читать: https://habr.com/ru/companies/selectel/articles/943634/

#ru

@big_data_analysis | Другие наши каналы

297 views12:35

Data Analysis / Big Data

🗣Интеллектуальная аналитика для data-driven компаний

11 сентября приглашаем BI-экспертов на Дельта Day — событие, посвящённое передовым тенденциям на рынке аналитики. Приходите и вы, если строите data-driven культуру в компании и хотите узнать больше о возможностях BI-систем.

На Дельта Day вы узнаете:

🔘На что обращать внимание при выборе BI-системы.
🔘Как интеграция BI и BPM помогает управлять продажами.
🔘Об особенностях дизайна и функционала мобильной аналитики.
🔘Чем Дельта BI отличается от других систем на рынке и подходит ли она именно вашему бизнесу.

Успейте зарегистрироваться — места ограничены.

311 views13:25

Data Analysis / Big Data

RocksDB-стейт в стриминге: как ловить потерянные события и дубликаты

В стриминговых пайплайнах всё чаще приходится иметь дело не только с бесконечным потоком данных, но и с состоянием, которое нужно хранить и восстанавливать без потерь. С выходом Spark 3.2 у разработчиков появилась возможность подключать RocksDB в качестве state store — и это открывает новые горизонты для работы с большими объёмами данных. В статье разбираем, как использовать этот подход на практике: от борьбы с дубликатами и пропущенными событиями до тонкостей конфигурации и устойчивости стриминга.

Читать: https://habr.com/ru/companies/otus/articles/941412/

#ru

@big_data_analysis | Другие наши каналы

295 views13:30

Data Analysis / Big Data

Скорость, стратегия и алгоритмы: будущее Формулы-1 в эпоху AI

Формула-1 всегда была местом пересечения инженерии и инноваций. В последние годы эта область инноваций расширилась за счёт внедрения искусственного интеллекта и машинного обучения.

От стратегии по выбору шин до аэродинамического дизайна — эти технологии меняют то, как команды планируют работу, реагируют на вызовы и развиваются. Они не заменяют человеческих специалистов, принимающих решения, но трансформируют набор инструментов, с которыми ведут борьбу за результат.

Читать: https://habr.com/ru/articles/937302/

#ru

@big_data_analysis | Другие наши каналы

333 views14:41

Data Analysis / Big Data

Arrow Flight + ADBC: как гонять десятки ГБ/с между сервисами без REST

Привет, Хабр!

Когда делаешь сервисы на C++ и вокруг летает много данных, в какой-то момент понимаешь простую вещь: REST хорош для управления сущностями, но плохо подходит для потока колонок в десятки гигабайт в секунду. Переносить фреймы по сто миллионов строк через JSON и спотыкаться об сериализацию — не наш путь. В статье рассмотрим как собрать транспорт данных на Apache Arrow Flight и где встраивается ADBC, чтобы между сервисами гонять таблицы почти на скорости сети и не городить зоопарк драйверов.

Читать: https://habr.com/ru/companies/otus/articles/941432/

#ru

@big_data_analysis | Другие наши каналы

332 views18:13

Data Analysis / Big Data

Как за год вырастить персонализацию на главной: эволюция рекомендаций в fashion ecom

Привет, Хабр! Меня зовут Данил Комаров, я дата-сайентист в команде персонализации Lamoda Tech. Уже больше года мы меняем подход к рекомендациям на главной странице, делая их персонализированными. Я расскажу, как мы внедряли и масштабировали решение, переводили его из оффлайна в онлайн, и бустили систему на разных слоях.

Читать: https://habr.com/ru/companies/lamoda/articles/943272/

#ru

@big_data_analysis | Другие наши каналы

319 views06:38

Data Analysis / Big Data

Три сказа о построении RAG: От выбора модели до форматирования базы знаний

Привет! Меня зовут Александр Золотых, уже два года я работаю во ВкусВилле разработчиком ИИ-решений. В этой статье хочу рассказать, как мы сделали карманного консультанта по клиентократии — и зачем вообще он понадобился.

ВкусВилл работает по клиентократии — модели управления, которую развивает и распространяет система управления Beyond Taylor. Основная особенность клиентократии — фокус на клиенте, когда все процессы компании выстраиваются для удовлетворения его потребности. Модель инновационная: погружаешься, и возникает множество вопросов. Конечно, лучше спросить и узнать, чем не спросить и не узнать, но не всем и не всегда это просто. Значит, нужно снижать порог входа и сделать описание модели ближе к изучающему.

Именно из этого понимания у нашей команды и появилась идея карманного консультанта — инструмента, который готов отвечать на все «глупые» и каверзные вопросы. Мы поделились замыслом с коллегами из Beyond Taylor, получили их поддержку и приступили к реализации. Так родилась наша первая задача с тем, что сейчас называется RAG (Retrieval-Augmented Generation).

Конечно, есть готовые решения (Notebook LM, Нейроэксперт), но они имеют несколько минусов:

Читать: https://habr.com/ru/companies/vkusvill/articles/944202/

#ru

@big_data_analysis | Другие наши каналы

349 views10:16

Data Analysis / Big Data

Dagster или Airflow: что выбрать для оркестрации в DWH-проектах?

Рассказываем, какие задачи решают оркестраторы в проектах внедрения корпоративных хранилищ данных. Выясняем, в чем разница между инструментами, и почему Dagster становится все популярнее в DWH-проектах, чем Airflow.

Читать: https://habr.com/ru/articles/944284/

#ru

@big_data_analysis | Другие наши каналы

344 views12:25

Data Analysis / Big Data

Цифровой профиль в ВТБ: как графы и эмбеддинги помогают банку понимать клиентов

Статья рассказывает о том, как банк строит единый цифровой профиль клиента, используя графы и эмбеддинги. Вы узнаете, как разрозненные данные о транзакциях, связях и балансах превращаются в мощный инструмент для анализа и прогнозирования. Разберем, почему классических табличных подходов недостаточно и как графы помогают выявлять скрытые связи между клиентами, как клиенты «превращаются в слова» и на чем измеряется успех. Статья будет полезна data scientist’ам, ML-инженерам и всем, кто интересуется практическим применением графовых методов и машинного обучения в крупном бизнесе.

Читать: https://habr.com/ru/companies/vtb/articles/944338/

#ru

@big_data_analysis | Другие наши каналы

374 views14:43

Data Analysis / Big Data

Практика Kafka: проектирование топиков и обмен сообщениями

Ранее мы с вами развернули кластер Kafka. Что дальше?

В этой статье, как всегда, переходим от теории к практике: разработаем собственные продюсер и консьюмер на Python. Это будет не просто демонстрация кода — мы погрузимся в детали работы с Kafka.

Подробно разберем структуру сообщений Kafka,

Углубимся в основы проектирования: от топиков до настройки клиентов,

На практике изучим ключевые процессы: сериализацию, партиционирование, батчинг и сжатие данных.

Читать: https://habr.com/ru/articles/944432/

#ru

@big_data_analysis | Другие наши каналы

👍3

399 views21:04

Data Analysis / Big Data

Аналитика преимуществ в Fusion Data Intelligence

Benefits Analytics в Fusion Data Intelligence помогает менеджерам и администраторам не просто обрабатывать данные, а извлекать важные инсайты для принятия более эффективных решений в управлении преимуществами сотрудников.

Читать подробнее

#en

@big_data_analysis | Другие наши каналы

Oracle

Unlocking Workforce Well-Being: Introducing the Benefits Subject Area in Oracle HCM Fusion Data Intelligence (FDI) – 25R2 Update

Explore how Benefits Analytics in Fusion Data Intelligence enables benefit managers and administrators to move beyond transactions and discover insights that shape better decisions.

454 views07:10

Data Analysis / Big Data

Uber превращает водителей в дата-лейблеров ИИ: пилот в Индии

Uber запустил пилот в 12 городах Индии: водители размечают данные для ИИ прямо в приложении, получая допдоход. Инициатива Uber AI Solutions может масштабироваться глобально.

Читать: «Uber превращает водителей в дата-лейблеров ИИ: пилот в Индии»

#ru

@big_data_analysis | Другие наши каналы

354 views13:18

Data Analysis / Big Data

zenplan: как я сделал себе карманного помощника для целей и задач

Привет, Хабр! 👋

Меня зовут Денис, я продуктовый аналитик, и как многие из нас, я постоянно разрываюсь между проектами, встречами, идеями и личными задачами. Список дел разрастается быстрее, чем успеваешь их выполнять, а заметки и цели теряются между Google Docs, Notion и стикерами на рабочем столе.

В какой-то момент я понял, что трачу больше времени на организацию задач, чем на сами задачи. И решил написать себе карманного помощника, который соберёт всё в одном месте. Так появился мой бот zen_plan_bot.

Читать: https://habr.com/ru/articles/945412/

#ru

@big_data_analysis | Другие наши каналы

298 views09:59

Data Analysis / Big Data

DataHub: Как интеллектуальный хаб данных меняет правила игры на рынке кредитования и займов

Финансовый рынок цифровизируется с невероятной скоростью: клиенты ждут персональных предложений за пару кликов, банки и МФО ищут качественных заемщиков, а партнеры — удобные и технологичные инструменты для монетизации трафика. На стыке этих интересов возникает потребность в принципиально новых решениях. Старые методы лидогенерации и скоринга уже не справляются: они либо не дают нужной глубины анализа.

Именно этот разрыв между потребностями рынка и существующими возможностями закрывает платформа DataHub. Это не просто очередной сервис, а целая экосистема, которая действует в интересах всех сторон: кредитора, партнера и, что самое важное, конечного клиента. Рассказываем, как мы создаем продукт, который подойдет для всех.

Читать: https://habr.com/ru/articles/945748/

#ru

@big_data_analysis | Другие наши каналы

👍1

296 views13:38

Data Analysis / Big Data

Автоматизируем подготовку промтов для GPT: Python-функция для детального описания DataFrame

Привет, меня зовут Виталий. Автор телеграмм канала "Детектив данных" про смену профессии и мой вкат в "аналитику" после 30 лет. И да, я уже наверное года полтора использую помощь нейросети при написании кода на Питоне.

Следствие установило, что для получения качественного ответа часто приходится потратить довольно много времени на описание таблицы, где какой тип данных, примеры, формат, количество nan значений, диапазон дат и прочие нюансы.

Будто при допросе вместо описания преступника, следователь внимательно изучает все родинки у допрашиваемого лица. И у адвоката.

В качестве жертвы у нас рабочее время, которое можно потратить на описание задачи.

В какой то момент я подумал, а почему бы не сделать универсальную функцию которая будет собирать эту информацию за меня, и сразу писать какой нибудь универсальный промт, потому что, до кучи мне и его лень писать.

В общем вашему вниманию предлагаю эту функцию. Всё что нужно, это вставить код в ячейку, и в следующей команде указать ваш датафрейм. Принт выведет вам готовый промт с описанием вашей таблицы, расскажет тип данных каждого столбца, покажет примеры значений, диапазоны и количество пропусков, а заодно проверит датафрейм на дубликаты.
Смотрим функцию, сохраняем

Читать: https://habr.com/ru/articles/945786/

#ru

@big_data_analysis | Другие наши каналы

❤1

320 views15:15

Data Analysis / Big Data

Готовим данные для LLM: открытые инструменты для нормализации, очистки и не только

Компании активно внедряют у себя решения на основе больших языковых моделей: боты техподдержки, умный поиск по базе знаний, выявление мошенников в диалоге или HR-ассистенты.

Но самостоятельно вывести модель в полноценное продакшн-использование не так просто. К тому же для разных сценариев нужно тестировать разные модели. Это требует больших усилий. Чтобы уменьшить порог входа в эту технологию, мы создали собственную платформу — MWS GPT. Под капотом — наша инфраструктура с GPU.

О том, как тестировать разные LLM в MWS GPT и запускать ИИ-агентов без кода скоро расскажем на вебинаре — присоединяйтесь.

Для обучения LLM требуются огромные и разнообразные датасеты. Однако качество данных часто важнее простого объёма: хорошие данные позволяют модели лучше обобщать и снижать ошибки. К счастью, есть открытые решения, способные помочь с их обработкой.

Сегодня делимся подборкой систем контроля качества ML-датасетов, проектом для автоматической категоризации и системой контроля версий для наборов данных.

Читать: https://habr.com/ru/companies/mws/articles/946126/

#ru

@big_data_analysis | Другие наши каналы

295 views14:54

Data Analysis / Big Data

Умный аналитик для ритейла: ИИ на службе бизнеса

Данные для ритейла жизненно необходимы: продажи, промо, возвраты, остатки, оборачиваемость. Классическая схема работы такова: бизнес-подразделение формулирует вопрос → аналитики превращают его в задачу → инженеры делают выгрузки → кто-то собирает отчет → отчет попадает на стол к ответственному лицу → через время появляется ответ.

Проблема в том, что скорость бизнеса и скорость проведения анализа не совпадают.

Руководителю дивизиона, директору магазина или маркетологу часто нужен ответ в моменте, а не через неделю. Но BI-процессы инерционны. Поэтому сегодня нужны другие инструменты, позволяющие получить свежие данные, проанализировать, задать вопрос – и получить не просто диаграмму, но выводы, рекомендации или даже конкретное выполненное действие.

Конструкторы отчетов устарели. В век GPT пользователь хочет общаться с данными.

Что с этим делать?
Читать статью

Читать: https://habr.com/ru/companies/sapiens_solutions/articles/946370/

#ru

@big_data_analysis | Другие наши каналы

253 views12:00

Data Analysis / Big Data

А вы точно умеете внедрять AI в бизнес?

Короткий гуглинг по теме показывает, что все рекомендации по внедрению ИИ в бизнесе сводятся к общим фразам. «Выделите одно приоритетное направление», «найдите рутинные операции», «проанализируйте доступные данные». Спасибо, кэп. А делать-то что?

Читать: https://habr.com/ru/articles/945648/

#ru

@big_data_analysis | Другие наши каналы

216 views13:06

Data Analysis / Big Data

Сквозь эпохи: от хаоса к гармонии, или как мы запросы в Greenplum улучшали

Привет, Хабр! Я Илья Назаров, старший инженер в разработке сервисов направления эксплуатации инфраструктуры данных DataPlatform Т-Банка. В работе я часто соприкасаюсь с движками баз данных. Первым и основным движком волею судеб стал Greenplum. Расскажу о своем длинном пути взаимодействия с «Зеленой сливой», как из хаоса и невежества я дошел до истины и гармонии.

В начале карьеры меня много чего удивляло. Тогда я еще не знал, что такое Greenplum,и плохо понимал, что такое MPP. Позднее коллеги на пальцах объяснили мне, что это «постгрес курильщика» и «постгрес поверх кучи постгресов».

Не менее удивительны для меня процессы. Например, процесс деплоя. Именно тогда я узнал, что в большом продакшене может быть деплой через правку SSH-скриптов на серверах.

В целом ситуация выглядела страшно интересно: скрипты, процессы деплоя и работы над задачами — все было в новинку. С одной стороны, большой багаж исторически сформированных до меня решений, с другой — большой уровень свободы и минимум ограничений, что как раз и способствовало постоянному росту энтропии и хаоса. Практически сразу я ощутил желание навести во всем порядок. А что из этого получилось — читайте в статье 😉

Читать: https://habr.com/ru/companies/tbank/articles/946450/

#ru

@big_data_analysis | Другие наши каналы

210 views14:35

About

Blog

Apps

Platform