Анализ данных (Data analysis) – Telegram

Анализ данных (Data analysis)

@data_analysis_ml

47.1K subscribers

2.65K photos

303 videos

1 file

2.3K links

Data science, наука о данных.

@haarrp - админ

@itchannels_telegram - 🔥 главное в ит

@ai_machinelearning_big_data - ML

@machinelearning_interview - вопросы с собесдований по Ml

РКН: clck.ru/3FmyAp

Download Telegram

About

Blog

Apps

Platform

Анализ данных (Data analysis)

47.1K subscribers

Анализ данных (Data analysis)

🚀 Новое исследование Hunyuan: Reinforcement Learning on Pre-training Data (RLPT)

Этот метод решает главную проблему масштабирования LLM - ограниченность размеченного текста.

🌟 RLPT даёт моделям возможность учиться рассуждениям напрямую на данных предобучения, без дорогой ручной разметки.

Как это работает:
1️⃣ Модель во время обучения сама исследует данные и учится более общим стратегиям рассуждений.
2️⃣ Никакой дополнительной разметки — награды извлекаются прямо из предобучающих данных.
3️⃣ Награды за предсказание следующего сегмента позволяют масштабировать RL на этапе предобучения.

Результаты:
✅ На Qwen3-4B-Base прирост: +3.0 (MMLU), +5.1 (MMLU-Pro), +8.1 (GPQA-Diamond), +6.0 (KOR-Bench), +6.6 (AIME24), +5.3 (AIME25).
✅ Чем больше вычислений, тем сильнее рост.
✅ Технология создаёт базу для дальнейших улучшений в RLVR.

📄 Подробнее: https://arxiv.org/pdf/2509.19249

#AI #RLPT #LLM #MachineLearning #NLP

@data_analysis_ml

❤14👍5🔥3

6.14K views08:18

Анализ данных (Data analysis)

Media is too big

VIEW IN TELEGRAM

⚡️ Tencent представила Hunyuan3D-Part, первую в своём роде open-source модель генерации 3D-объектов на уровне деталей, которая обгоняет все существующие открытые и закрытые решения.

Главное:
🔹 P3-SAM — первая нативная 3D-модель сегментации деталей
🔹 X-Part — генератор деталей с SOTA-результатами по управляемости и качеству

Ключевые особенности:
1️⃣ Обучение на 3.7 млн форм с чистыми аннотациями без использования 2D SAM
2️⃣ Новый автоматический пайплайн сегментации в 3D — полностью без участия пользователя
3️⃣ Диффузионный пайплайн для разбиения на части с учётом геометрии и семантики

Код доступен на GitHub, веса выложены на Hugging Face, а протестировать модель можно как в облегчённой версии на Hugging Face, так и в полном формате через Hunyuan3D Studio.

→Code: https://github.com/Tencent-Hunyuan/Hunyuan3D-Part
→ Веса: https://huggingface.co/tencent/Hunyuan3D-Part
→ Paper: https://arxiv.org/abs/2509.06784
→ Project page: https://murcherful.github.io/P3-SAM/
Попробовать：
→ (Light version) Hugging Face demo: https://huggingface.co/spaces/tencent/Hunyuan3D-Part
→ (Full version) Hunyuan3D Studio: https://3d.hunyuan.tencent.com/studio

Please open Telegram to view this post

VIEW IN TELEGRAM

❤10👍4🔥2👏1

4.85K views09:09

Анализ данных (Data analysis)

🎛️ Claude Squad

Инструмент ориентирован на управление несколькими терминальными агентами искусственного интеллекта (Claude Code, Aider, Codex, OpenCode и Amp).

Проект помогает организовывать взаимодействие разных ИИ и командных инструментов и привлёк более 3,6 тыс. звёзд.

🟠

Ссылка

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤6👍4🔥1

5.08K views14:03

Анализ данных (Data analysis)

⚡️ Новые модели для кодинга от Kwaipilot: KAT-Dev-32B и KAT-Coder

- KAT-Dev-32B — 62.4% на SWE-Bench Verified, входит в топ-5 среди open-source моделей
- KAT-Coder — 73.4% на SWE-Bench Verified, результат на уровне лучших проприетарных решений

🔗 Попробовать: https://huggingface.co/Kwaipilot/KAT-Dev

2❤6🔥5👍4

4.85K views08:14

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

🆕

Hugging Face представили **AI Sheets** — no-code инструмент для создания и обработки таблиц с помощью ИИ.

- Выглядит как обычная таблица, но вместо формул — тысячи моделей
- Поддержка OpenAI-совместимых и локальных LLM
- Можно добавлять столбцы с промптами, редактировать данные вручную или через лайки
- Запуск онлайн или локально (Docker / pnpm)
- Полностью опенсорс (Apache-2.0), легко встроить в пайплайны
- Подходит для классификации, трансформации данных, синтетики и «vibe-тестов» моделей

⚡️ Попробовать

#AI #NoCode #datasets #HuggingFace #LLM

Please open Telegram to view this post

VIEW IN TELEGRAM

❤15🔥4👍2👏2

5.09K views15:00

Анализ данных (Data analysis)

Alibaba Group представила Memp — новый фреймворк, который даёт LLM-агентам обучаемую и обновляемую процедурную память.

📈 Результат — более высокая успешность и эффективность при сложных задачах.
🧠 Memp превращает прошлый опыт агентов в детальные инструкции и абстрактные стратегии, постоянно совершенствуясь по мере накопления данных.
🔄 Память можно даже передавать более слабым моделям, повышая их возможности.

https://huggingface.co/papers/2508.06433

❤8👍6🔥3❤‍🔥1

4.91K views09:01

Анализ данных (Data analysis)

🔊 OpenAI готовится выпускать свое первое «железо» к 2026–2027

Что происходит:
- В OpenAI пришло уже более 24 специалистов из Apple в этом году - в области интерфейсов, камер, аудио, носимых устройств и производства. Команду ведёт Тан Тан, 25 лет проработавший в Apple, теперь - Chief Hardware Officer OpenAI.
- Один из описанных концептов - умная колонка без экрана, плюс исследуются очки, диктофон и носимый пин - как дополнение к смартфону или ноутбуку.
- OpenAI обсуждает модули колонок с Goertek и опирается на китайскую цепочку поставок Apple, что ускорит массовый запуск, но усиливает геополитические риски.
- Фундамент — сделка на $6,5 млрд: покупка io Products у Джони Айва, чья команда теперь интегрирована в OpenAI (при этом LoveFrom продолжает независимую работу).

⚡ Реалии рынка: провал Humane Pin (HP купила и закрыла за $116M) показывает, насколько жестким является сегмент.

🎙️ Если первый продукт будет без экрана и голосоцентричным - успех зависит от:
- дальнобойных микрофонных массивов
- beamforming и низкой задержки wake word
- on-device фильтрации
- плавного облачного хэнд-оффа для быстрых ответов в реальных условиях.

Источник: https://www.theinformation.com/articles/openai-raids-apple-hardware-talent-manufacturing-partners

🔥8❤3👍2🤔2🤨2

4.59K viewsedited 12:27

Анализ данных (Data analysis)

🚀 Вышел Postgres 18 — с поддержкой Async I/O

Раньше все операции чтения были блокирующими, теперь - нет.

Результат: огромный прирост производительности для приложений с интенсивным чтением.

⚡️ Async I/O включён по умолчанию в Postgres 18!

Что интересного:
- Новый алгоритм skip scan для многостолбцовых индексов
- Параллельное построение GIN-индексов (JSON, полнотекст)
- Виртуальные генерируемые столбцы (значения считаются на лету)
- Функция uuidv7() — UUID с временной сортировкой
- Сохранение статистики планировщика при мажорных апгрейдах
- Поддержка OAuth 2.0, улучшения TLS и безопасности
- Новый протокол взаимодействия клиентов и утилит — v3.2

🟠

Релиз: https://www.postgresql.org/about/news/postgresql-18-released-3142/

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥28👍7❤4

6.17K views13:03

Анализ данных (Data analysis)

💸 BigTech удваивает ставки на ИИ

- В 2025 компании потратят $345 млрд на AI-инфраструктуру - рост в 2,5 раза за два года.
- Для сравнения: мировой телеком тратит ~$1,5 трлн.
- Проект OpenAI Stargate ($500 млрд к 2029) = ~25% от прогнозируемых $2 трлн при росте в 58% год за годом.

Сэм Альтман видит экспоненту — и она уже в цифрах.

❤8😁1

4.36K views14:12

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

Save the date — 30 октября идем на Яндекс Analytics Talks Meetup

Аналитики Городских сервисов Яндекса расскажут о том, как эффективно использовать данные и искать точки роста продуктов. В программе:
Доклады о том, как создавать продукты и делать их лучше для пользователей. Поговорим про новые фичи, поделимся метриками и сложностями при запусках. Дискуссия про LLM и GenAI в контексте DWH и аналитики — обсудим, приносят ли инструменты реальную пользу или это только хайп.
А еще афтепати с настолками и неформальное общение с экспертами Городских сервисов Яндекса.

📌 30 октября, сбор гостей с 18:00
📌 Москва, офлайн

Регистрируйтесь и зовите друзей!

Мероприятие бесплатное. Количество мест ограничено — пожалуйста, дождитесь нашего подтверждения.

🥱3❤1

4.36K views16:03

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

🚀 Datarus Jupyter Agent: Умный анализ данных

Datarus Jupyter Agent — это мощная система многоступенчатого рассуждения, позволяющая выполнять сложные аналитические задачи с автоматическим восстановлением ошибок и синтезом результатов. Интеграция с Jupyter и Docker обеспечивает надежную среду для анализа данных.

🚀 Основные моменты:
- Многоступенчатое рассуждение с использованием модели Datarus
- Интеграция с Docker для изолированного выполнения
- Поддержка TensorFlow, PyTorch и scikit-learn
- Автоматическое восстановление ошибок
- Управление Jupyter-ноутбуками и экспорт результатов

📌 GitHub: https://github.com/DatarusAI/Datarus-JupyterAgent

@data_analysis_ml

❤8👍3🔥2

4.76K views17:01

Анализ данных (Data analysis)

🧲 Caltech сделал рекордный квантовый компьютер — 6 100 кубитов на нейтральных атомах.

💡 В чём прорыв:

Кубиты держатся 12,6 секунд - значит, можно сделать миллионы операций, пока они не «сломаются» от шума.

Управление с точностью 99,98% - критично, потому что коррекция ошибок работает только при редких сбоях.

Лазеры-«пинцеты» разделяют один луч на 12 000 мини-ловушек, которые удерживают атомы в вакууме.

Атомы можно переставлять, не теряя квантовое состояние - это даёт гибкость системе.

🚀 Конкуренты (IBM, Quantinuum) тоже гонят: цель — 100 000 кубитов к 2033 году и полная защита от ошибок к 2029.

decrypt.co/341716/caltech-builds-worlds-largest-neutral-atom-quantum-computer

👍12🤣6❤3🔥1

4.38K views09:16

Анализ данных (Data analysis)

🔥 Zai_org выпускает GLM 4.6!

Новая версия в линейке GLM получила улучшения сразу во всех ключевых направлениях:
- программирование и работа с кодом
- обработка длинных контекстов
- улучшенное рассуждение и поиск
- генерация текста и написание статей
- агентные кейсы и применение в приложениях

RELEASE: https://z.ai/blog/glm-4.6
MODEL 🔜 https://huggingface.co/zai-org/GLM-4.6
Docs: https://docs.z.ai/guides/llm/glm-4.6

🔥5❤3👍3

4.37K views11:55

Анализ данных (Data analysis)

🚀 Мощные мультимодальные модели LLaVA-OneVision-1.5

LLaVA-OneVision-1.5 — это открытая платформа для обучения мультимодальных моделей, демонстрирующая выдающиеся результаты при низких затратах. Модели обучаются на высококачественных данных и обеспечивают превосходную эффективность.

🚀 Основные моменты:
- Полностью открытый исходный код и данные для обучения
- Высокое качество и разнообразие обучающих данных
- Эффективная структура для экономного обучения
- Поддержка современных технологий, таких как MoE и FP8
- Оптимизированный код для масштабируемости

📌 GitHub: https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-1.5

#python

❤4👍2

4.23K views14:02

Анализ данных (Data analysis)

🔥

Refly — это открытая AI-платформа для создания контента с интуитивным интерфейсом на основе свободного полотна!

🌟 Она поддерживает многопоточные диалоги, интеграцию с базами знаний, контекстную память, интеллектуальный поиск и WYSIWYG-редактор. Refly помогает легко превращать идеи в готовый контент, поддерживает облачное и локальное развертывание через Docker.

🔐 Лицензия: Apache-2.0

🖥

Github

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

👍8🔥4

4.96K views18:02

Анализ данных (Data analysis)

🧠 Интеллектуальный исследовательский агент для глубоких исследований

SGR Research Agent использует Schema-Guided Reasoning для автоматического планирования и цитирования. Он поддерживает многоязычность и адаптируется к изменениям в данных, обеспечивая структурированные отчеты с источниками.

🚀 Основные моменты:
- 🤔 Приоритет уточнений при неопределенности
- 🔄 Автоматическая адаптация плана
- 📎 Управление источниками и цитированием
- 🌍 Поддержка русского и английского языков
- 📊 Генерация детализированных отчетов в Markdown

📌 GitHub: https://github.com/vakovalskii/sgr-deep-research

#python

❤12🔥5👍4😁2

4.66K views11:03