Анализ данных (Data analysis) – Telegram

Анализ данных (Data analysis)

@data_analysis_ml

46.8K subscribers

2.6K photos

299 videos

1 file

2.26K links

Data science, наука о данных.

@haarrp - админ

@itchannels_telegram - 🔥 главное в ит

@ai_machinelearning_big_data - ML

@machinelearning_interview - вопросы с собесдований по Ml

РКН: clck.ru/3FmyAp

Download Telegram

About

Blog

Apps

Platform

Анализ данных (Data analysis)

46.8K subscribers

Анализ данных (Data analysis)

🧩 Как GPT модели менялись от GPT-2 до gpt-oss

Себастьян Рашка написал статью о том, какие архитектурные фишки появились в новых open-weight моделях OpenAI — gpt-oss.

📌 Что изменилось:
• Добавили Mixture-of-Experts — модель выбирает только часть экспертов, что даёт больше мощности без взрыва по параметрам.
• Ввели Grouped Query Attention — ускоряет работу с большими контекстами.
• Появились sliding-window слои — можно обрабатывать длинные тексты эффективнее.
• gpt-oss оптимизировали под reasoning, работу с инструментами и агентов.

✏️ Автор сравнивает gpt-oss с Qwen3 и другими моделями, показывая, как эволюция архитектуры влияет на скорость и качество.

👉 Полный разбор тут: https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the

1👍16❤8🔥4

5.17K views08:11

Анализ данных (Data analysis)

📊 Неожиданная статистика по ИИ-ассистентам

Сообщают, что Microsoft Copilot значительно опережает Gemini по числу пользователей. На первый взгляд это выглядит странно.

Возможное объяснение: речь идёт не о реальном использовании, а о количестве активированных аккаунтов и доступе по умолчанию (Copilot встроен в Windows и Office).

Ещё более удивительно, что Claude якобы сильно отстаёт — и это тоже вызывает вопросы, ведь его активно используют в сообществе.

⚡️ Мораль: статистику по ИИ стоит читать внимательно — важно, что именно считают: доступ, активации или реальное использование.

https://gs.statcounter.com/ai-chatbot-market-share#monthly-202508-202508-bar

#ai #copilot #gemini #claude

😁9❤7👍3🔥2

4.53K views16:01

Анализ данных (Data analysis)

🔥 OpenAI объявила о перестройке команд

➡️ Команда Model Behavior (14 человек), которая занималась настройкой “личности” ChatGPT, снижением угодничества и проработкой политической предвзятости, теперь войдёт в состав более широкой Post-Training org.

👩‍💻 Её основатель, Джоанн Джанг, запускает новый экспериментальный проект OAI Labs, где будут тестировать свежие форматы взаимодействия человека и ИИ.

⚡ Перемены показывают: управление личностью модели становится ключевым направлением разработки. Это ответ OpenAI на жалобы пользователей на “холодные” ответы GPT-5 и продолжающиеся дискуссии о безопасности чатботов.

❤13👍6🔥2😐2

4.78K views20:46

Анализ данных (Data analysis)

⚡️

DeepCode — открытая AI-платформу для автоматической генерации кода.

DeepCode превращает научные статьи и технические документы в готовые проекты, включая фронтенд, бэкенд и полноценные репозитории.

🔹 Основные возможности:
• Paper2Code — реализация идей из исследований в рабочий код
• Text2Web — генерация интерфейсов по описанию
• Text2Backend — автоматическое создание масштабируемых серверов
• Поддержка длинных документов и многофайловых проектов

🔜 В ближайшее время разработчики обещают:
• Автоматическую проверку и валидацию кода
• Повышение скорости генерации
• Улучшенную работу с требованиями
• Бенчмарки воспроизведения научных статей (PaperBench)

Проект полностью open source: https://github.com/HKUDS/DeepCode

#deepcode #AI #coding

Please open Telegram to view this post

VIEW IN TELEGRAM

❤13👍8🔥4🤨2

5.01K views11:03

Анализ данных (Data analysis)

💾 Зачем нужен Delta Lake, если есть Parquet

Обычный Parquet хранит только одно состояние таблицы.
Если вы сохранили отфильтрованный DataFrame, то старые данные исчезли навсегда.
❌ Отката (rollback) нет → потеряли 10 000 строк, осталось только 3 500.

⚡ Delta Lake работает иначе:
- каждый раз создаётся новая версия данных
- можно вернуться к любой версии в прошлом
- данные всегда под контролем и без потерь

📌 Пример:
- Parquet → фильтр → оригинал стёрт
- Delta Lake → версия 0 (10 000 строк) + версия 1 (3 500 строк) → всегда можно вернуться к версии 0

✅ Итог: с Delta Lake данные становятся версионируемыми и надёжными.

#datalake #parquet #bigdata #delta

🔥14❤8🤨4😐2

4.52K views17:03

Анализ данных (Data analysis)

🚀 NVIDIA представила Rubin CPX — новый класс GPU для inference с огромным контекстом

🔑 Что интересно
- Rubin CPX — специализированный GPU для обработки контекста размером до миллиона токенов (код, видео, длинные последовательности).
- Интеграция в платформу Vera Rubin NVL144 CPX:
- До 8 экзафлопс вычислений ИИ
- 100 ТБ быстрой памяти
- 1,7 ПБ/с пропускной способности
- Превосходит GB300 NVL72 по производительности на 7,5×.
- Характеристики:
- 30 PFLOPS вычислений в NVFP4
- 128 ГБ GDDR7 памяти
- 3× ускоренные attention-механизмы для длинного контекста
- Поддержка всего AI-стека NVIDIA: Dynamo, Nemotron, CUDA-X, AI Enterprise.
- Выход ожидается в конце 2026 года.

Rubin CPX задаёт новый стандарт для аппаратной архитектуры в AI.

Это фундамент для моделей, которые смогут полноценно работать с огромными контекстами, не теряя деталей и качества.

https://nvidianews.nvidia.com/news/nvidia-unveils-rubin-cpx-a-new-class-of-gpu-designed-for-massive-context-inference

🔥11❤5👍5🍌1

4.96K viewsedited 19:44

Анализ данных (Data analysis)

Ты: «Эх, вот бы кто-то научил анализировать данные, чтобы у меня было больше шансов поступить в вуз и начать карьеру…»
Яндекс Лицей: «Ок»

Запускаем новый набор для учащихся школ и колледжей на инстивный, трёхмесячный курс по анализу данных. Научим работать с Python не в теории, а на практике: верно анализировать, точно делать выводы и красиво показывать результаты.

Сделали такой онлайн-курс, чтобы мог пригодиться и в обучении, и в карьере. Поэтому:

1. Сделали упор на практику и только нужную теорию
2. Только те задачи, которые действительно решают в компаниях
3. Ввели командную разработку

Ну и финальное: после обучения получите именной сертификат. Он может помочь получить дополнительные баллы при поступлении в некоторых вузах.

Обучение в Яндекс Лицее бесплатно, но есть отбор. Он открыт до 23 сентября. Вся программа, подробности и регистрация на новый поток по ссылке.

❤5👍5🔥3

4.94K views08:01

Анализ данных (Data analysis)

📖 Новая работа ByteDance + Harvard: *Mycroft: Tracing Dependencies in Collective Communication Towards Reliable LLM Training*

Mycroft - система, которая помогает понять, почему обучение LLM на кластере GPU тормозит или падает.

🚧 Проблема
При распределённом обучении сотни GPU постоянно обмениваются данными через библиотеку NCCL. Она работает как «чёрный ящик»: при сбое видно только таймауты или падение скорости, но непонятно, где именно сбой.

🛠 Решение — Mycroft
- «Подглядывает» внутрь процесса обмена данными
- Каждые 100 мс пишет лёгкие статусы: сколько данных подготовлено, отправлено и завершено
- Если прогресс застопорился → сразу сигнал
- Отслеживает зависимости между GPU и определяет: проблема в конкретной карте, сетевой карте или шине

⚡ Результаты
- В тестах на 32 GPU и в проде у ByteDance
- Находит сбой за ~**15 секунд**
- Указывает точный компонент за <**20 секунд**
- Нагрузка на обучение почти нулевая

🔗 https://arxiv.org/abs/2509.03018

#AI #LLM #GPU #DistributedTraining #ByteDance #Harvard

❤6🔥6👍5

4.97K views10:03

Анализ данных (Data analysis)

⚡ Ускорение PyTorch-инференса на Apple-устройствах на 87% с помощью AI-сгенерированных Metal-ядр

В новом исследовании показано, как AI-модели автоматически генерируют оптимизированные GPU-ядра под Metal, которые ускоряют работу PyTorch на устройствах Apple.

📊 Результаты:
- В среднем прирост скорости - 87% на 215 модулях.
- Некоторые ядра работают в сотни раз быстрее базового уровня.

🟢 Как это работает:
- Используется agentic swarm-подход - несколько агентов генерируют и тестируют варианты ядер.
- В контекст добавляются CUDA-референсы и данные профилирования, что помогает создавать более эффективные ядра.
- Такой метод превосходит одиночные модели, генерирующие код без дополнительного контекста.

Fвтоматическая генерация GPU-ядер AI-моделями открывает путь к более быстрому и доступному инференсу прямо «из коробки» на Mac и iOS.

🔗 Подробности: https://gimletlabs.ai/blog/ai-generated-metal-kernels

Please open Telegram to view this post

VIEW IN TELEGRAM

👍7❤6🔥6

5.38K views12:04

Анализ данных (Data analysis)

🤖 Прорыв в разработке наноботов

Учёные из Penn State сделали важный шаг к созданию настоящих наноботов.

🔬 С помощью нового микро-флюидного устройства они создали крошечные частицы, которые могут обмениваться сигналами и действовать вместе - как муравьи, оставляющие следы для других.
- Одна группа частиц двигалась по химическому градиенту и оставляла «след».
- Другая группа улавливала этот след и шла за ним.

👉 Это выглядит просто, но именно так закладывается основа программируемых роёв наноботов.

💡 Возможные применения:
- наночастицы находят опухоль и зовут другие с лекарством,
- мини-системы доставляют груз в нужную клетку,
- наноботы очищают организм от токсинов или восстанавливают повреждённые ткани.

Раньше учёные могли наблюдать за таким процессом всего несколько секунд. Теперь, с новым инструментом Penn State, поведение можно изучать минутами, что позволяет проводить более сложные эксперименты.

🌱 Вдохновение пришло из природы - у пчёл и муравьёв есть распределение ролей и совместная работа. Если частицы смогут делать то же самое, это приблизит нас к самоорганизующимся автономным наносистемам, которые могут изменить медицину и материалы.

Это пока ранняя стадия, но именно такие шаги строят фундамент для будущих роёв наноботов.

https://www.psu.edu/news/eberly-college-science/story/can-nanobots-play-follow-leader

👍17❤9🔥6🤯3

6.81K viewsedited 20:45

Анализ данных (Data analysis)

💰Perplexity привлекла $200M при оценке в $20B.

Это произошло всего через два месяца после предыдущего раунда в $100M при оценке $18B. Общий объём инвестиций приближается к $1.5B.

📊 Выручка (ARR) уже почти $200M (месяц назад была $150M).
💡 Оценка в $20B при $200M ARR даёт мультипликатор ~100x - это возможно только при очень быстром росте и низком уровне оттока пользователей.

Perplexity выделяется тем, что отвечает на запросы с источниками и краткими сводками, заменяя «охоту за ссылками» на результат, сгенерированный моделью.
Но такой дизайн требует больших вычислительных мощностей: каждый запрос запускает веб-поиск, инференс LLM и генерацию ответа в реальном времени.

Источник: https://techcrunch.com/2025/09/10/perplexity-reportedly-raised-200m-at-20b-valuation/

#AI #Perplexity #Funding #Startups #LLM #Investments

👍10🔥8❤6

4.94K views09:00

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

⚡️ На чистом SQL запустили легендарный DOOM — прямо внутри базы данных CedarDB!

Игра не просто работает, а поддерживает многопользовательский режим, отрисовывая всё с помощью ASCII-графики.
Каждый компонент — от рендера до синхронизации игроков — написан исключительно на SQL-запросах.

🎮 GitHub для настоящих ценителей извращённого кода: https://github.com/cedardb/DOOMQL

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤23🔥12🤣10👍7🌚1

29.9K viewsedited 13:56

Анализ данных (Data analysis)

🚨 Китайцы выкатили мощнейшую новинку в AI-редактировании изображений — и она обошла Google Nanobanana, став №1!

🔥 Bytedance Seedream 4 впечатляет:
- ⚡️ Генерация в 2K за <2 секунд, поддержка 4K
- 🖼️ Можно создавать сразу несколько картинок в одном запросе
- 🎯 Намного стабильнее, чем nano🍌, которая часто просто возвращает исходное изображение

💰 Цена — всего $0.03 за генерацию.

https://fal.ai/models/fal-ai/bytedance/seedream/v4/edit

❤13🔥11👍4

4.84K viewsedited 16:31

Анализ данных (Data analysis)

🚀 Оптимизация обновления весов моделей в LLM

Checkpoint Engine — это легковесное промежуточное ПО для обновления весов в LLM во время инференса, критически важное для обучения с подкреплением. Оно обеспечивает быстрые и эффективные методы обновления весов, позволяя обрабатывать модели с триллионом параметров за считанные секунды.

🚀 Основные моменты:
- Поддержка двух методов обновления: Broadcast и P2P.
- Эффективная передача данных с использованием CUDA IPC.
- Оптимизированный процесс передачи с учетом шардирования.
- Подходит для работы с большими моделями на множестве GPU.

📌 GitHub: https://github.com/MoonshotAI/checkpoint-engine

❤10👍4🔥4

4.84K views18:00

Анализ данных (Data analysis)

🚀 Новый релиз: Smart Turn v3

🎙️ Это модель, которая понимает, когда человек закончил говорить и ждёт ответа от голосового ассистента.

⚡ Особенности:
- Работает супербыстро: <60мс на обычном CPU, <10мс на GPU
- Поддержка 23 языков (можно добавлять новые через сообщество)
- Полностью открытая: данные, код, обучение
- Бесплатно использовать даже на CPU

🟢

Blog: https://daily.co/blog/announcing-smart-turn-v3-with-cpu-inference-in-just-12ms/

🟢

GitHub: https://github.com/pipecat-ai/smart-turn/

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥10❤5👍5

4.76K viewsedited 08:26

Анализ данных (Data analysis)

🔥 Новинка от S-Lab, Nanyang Technological University и SenseTime Research: Next Visual Granularity Generation (NVG)!

🖼️ Новый фреймворк поэтапно улучшает изображение — от общего макета до мельчайших деталей, позволяя получить тонкий контроль над процессом генерации.

📊 Результаты впечатляют: NVG превзошёл серию VAR по метрикам FID!

huggingface.co/papers/2508.12811

Paper page - Next Visual Granularity Generation

Join the discussion on this paper page

❤7👍4🔥1

4.6K views11:01