Анализ данных (Data analysis)

🚀 Вышел Postgres 18 — с поддержкой Async I/O

Раньше все операции чтения были блокирующими, теперь - нет.

Результат: огромный прирост производительности для приложений с интенсивным чтением.

⚡️ Async I/O включён по умолчанию в Postgres 18!

Что интересного:
- Новый алгоритм skip scan для многостолбцовых индексов
- Параллельное построение GIN-индексов (JSON, полнотекст)
- Виртуальные генерируемые столбцы (значения считаются на лету)
- Функция uuidv7() — UUID с временной сортировкой
- Сохранение статистики планировщика при мажорных апгрейдах
- Поддержка OAuth 2.0, улучшения TLS и безопасности
- Новый протокол взаимодействия клиентов и утилит — v3.2

🟠

Релиз: https://www.postgresql.org/about/news/postgresql-18-released-3142/

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥28👍7❤4

6.17K views13:03

Анализ данных (Data analysis)

💸 BigTech удваивает ставки на ИИ

- В 2025 компании потратят $345 млрд на AI-инфраструктуру - рост в 2,5 раза за два года.
- Для сравнения: мировой телеком тратит ~$1,5 трлн.
- Проект OpenAI Stargate ($500 млрд к 2029) = ~25% от прогнозируемых $2 трлн при росте в 58% год за годом.

Сэм Альтман видит экспоненту — и она уже в цифрах.

❤7😁1

4.36K views14:12

Анализ данных (Data analysis)

0:11

This media is not supported in your browser

VIEW IN TELEGRAM

Save the date — 30 октября идем на Яндекс Analytics Talks Meetup

Аналитики Городских сервисов Яндекса расскажут о том, как эффективно использовать данные и искать точки роста продуктов. В программе:
Доклады о том, как создавать продукты и делать их лучше для пользователей. Поговорим про новые фичи, поделимся метриками и сложностями при запусках. Дискуссия про LLM и GenAI в контексте DWH и аналитики — обсудим, приносят ли инструменты реальную пользу или это только хайп.
А еще афтепати с настолками и неформальное общение с экспертами Городских сервисов Яндекса.

📌 30 октября, сбор гостей с 18:00
📌 Москва, офлайн

Регистрируйтесь и зовите друзей!

Мероприятие бесплатное. Количество мест ограничено — пожалуйста, дождитесь нашего подтверждения.

🥱3❤1

4.36K views16:03

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

🚀 Datarus Jupyter Agent: Умный анализ данных

Datarus Jupyter Agent — это мощная система многоступенчатого рассуждения, позволяющая выполнять сложные аналитические задачи с автоматическим восстановлением ошибок и синтезом результатов. Интеграция с Jupyter и Docker обеспечивает надежную среду для анализа данных.

🚀 Основные моменты:
- Многоступенчатое рассуждение с использованием модели Datarus
- Интеграция с Docker для изолированного выполнения
- Поддержка TensorFlow, PyTorch и scikit-learn
- Автоматическое восстановление ошибок
- Управление Jupyter-ноутбуками и экспорт результатов

📌 GitHub: https://github.com/DatarusAI/Datarus-JupyterAgent

@data_analysis_ml

❤8👍3🔥2

4.76K views17:01

Анализ данных (Data analysis)

🧲 Caltech сделал рекордный квантовый компьютер — 6 100 кубитов на нейтральных атомах.

💡 В чём прорыв:

Кубиты держатся 12,6 секунд - значит, можно сделать миллионы операций, пока они не «сломаются» от шума.

Управление с точностью 99,98% - критично, потому что коррекция ошибок работает только при редких сбоях.

Лазеры-«пинцеты» разделяют один луч на 12 000 мини-ловушек, которые удерживают атомы в вакууме.

Атомы можно переставлять, не теряя квантовое состояние - это даёт гибкость системе.

🚀 Конкуренты (IBM, Quantinuum) тоже гонят: цель — 100 000 кубитов к 2033 году и полная защита от ошибок к 2029.

decrypt.co/341716/caltech-builds-worlds-largest-neutral-atom-quantum-computer

👍11🤣6❤3🔥1

4.38K views09:16

Анализ данных (Data analysis)

🔥 Zai_org выпускает GLM 4.6!

Новая версия в линейке GLM получила улучшения сразу во всех ключевых направлениях:
- программирование и работа с кодом
- обработка длинных контекстов
- улучшенное рассуждение и поиск
- генерация текста и написание статей
- агентные кейсы и применение в приложениях

RELEASE: https://z.ai/blog/glm-4.6
MODEL 🔜 https://huggingface.co/zai-org/GLM-4.6
Docs: https://docs.z.ai/guides/llm/glm-4.6

🔥5❤3👍2

4.37K views11:55

Анализ данных (Data analysis)

🚀 Мощные мультимодальные модели LLaVA-OneVision-1.5

LLaVA-OneVision-1.5 — это открытая платформа для обучения мультимодальных моделей, демонстрирующая выдающиеся результаты при низких затратах. Модели обучаются на высококачественных данных и обеспечивают превосходную эффективность.

🚀 Основные моменты:
- Полностью открытый исходный код и данные для обучения
- Высокое качество и разнообразие обучающих данных
- Эффективная структура для экономного обучения
- Поддержка современных технологий, таких как MoE и FP8
- Оптимизированный код для масштабируемости

📌 GitHub: https://github.com/EvolvingLMMs-Lab/LLaVA-OneVision-1.5

#python

❤4👍2

4.23K views14:02

Анализ данных (Data analysis)

🔥

Refly — это открытая AI-платформа для создания контента с интуитивным интерфейсом на основе свободного полотна!

🌟 Она поддерживает многопоточные диалоги, интеграцию с базами знаний, контекстную память, интеллектуальный поиск и WYSIWYG-редактор. Refly помогает легко превращать идеи в готовый контент, поддерживает облачное и локальное развертывание через Docker.

🔐 Лицензия: Apache-2.0

🖥

Github

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

👍8🔥4

4.95K views18:02

Анализ данных (Data analysis)

🧠 Интеллектуальный исследовательский агент для глубоких исследований

SGR Research Agent использует Schema-Guided Reasoning для автоматического планирования и цитирования. Он поддерживает многоязычность и адаптируется к изменениям в данных, обеспечивая структурированные отчеты с источниками.

🚀 Основные моменты:
- 🤔 Приоритет уточнений при неопределенности
- 🔄 Автоматическая адаптация плана
- 📎 Управление источниками и цитированием
- 🌍 Поддержка русского и английского языков
- 📊 Генерация детализированных отчетов в Markdown

📌 GitHub: https://github.com/vakovalskii/sgr-deep-research

#python

❤12🔥5👍3😁2

4.65K views11:03

Анализ данных (Data analysis)

🔥 Новая SOTA среди моделей на 1.5B параметров

QuestA 🤖 показывает двузначный прирост Pass@1 и даже обгоняет ранние 32B-модели:
- AIME24: 72.50% (+10.73%)
- AIME25: 62.29% (+12.79%)
- HMMT25: 41.67% (+10.11%)

🚀 Секрет в обучении: QuestA использует RL с scaffolded-problems — это снимает конфликт между лёгкими и сложными задачами и даёт более масштабируемое рассуждение.

🔓 Всё в открытом доступе:
- Модель: https://huggingface.co/foreverlasting1202/QuestA-Nemotron-1.5B
- Тренировочный пайплайн: https://github.com/foreverlasting1202/QuestA
- Статья: https://arxiv.org/abs/2507.13266
- Блог: https://mercurial-kidney-02d.notion.site/QuestA-Expanding-Reasoning-Capacity-in-LLMs-via-Question-Augmentation-216b21d08abb81a1bcecfe79e7d1e88a?pvs=73

#LLM #Reasoning #AI #SOTA

@data_analysis_ml

❤6👍3🔥2

7.89K views14:24

Анализ данных (Data analysis)

💰 The Information пишет: Мира Мурати привлекла рекордные $2 млрд для своего нового ИИ-стартапа при оценке $10–12 млрд. Это крупнейший посевной раунд в истории США.

Мурати сохранила полный контроль над компанией: её голос в совете директоров весит больше всех остальных вместе взятых, а у основателей акции с 100-кратным правом голоса.

Инвесторы: Andreessen Horowitz, Accel, Nvidia, AMD и Cisco.

Ставка делается на доступ к вычислительным мощностям, выход в корпорации и масштабирование.

В команду стартапа вошёл Джон Шульман (сооснователь OpenAI) и группа экс-исследователей. Фокус команды будет направлен на обучение моделей и совершенствование их архитектуры.

Компания зарегистрирована как public benefit corporation, обещает открытые публикации и первый продукт уже в ближайшие месяцы (дропнутчто-то в open-source).

🎯 Главная идея стартапа: сделать ИИ предсказуемым и детерминированным.

Команда Мурати уверена, что это решаемая проблема. Если убрать случайность, ИИ станет безопасным для медицины, финансов и других критичных областей.

Источник: theinformation.com/articles/10-billion-enigma-mira-murati

❤12👍5🤣4🔥3🤯1

4.82K views16:24

Анализ данных (Data analysis)

🧠 RamTorch: Эффективное использование памяти для глубокого обучения

RamTorch — это библиотека для PyTorch, оптимизирующая использование памяти при обучении и выводе больших моделей, которые не помещаются в память GPU. Она использует гибридные реализации компонентов нейронных сетей, храня параметры в памяти CPU и передавая их на GPU по мере необходимости.

🚀 Основные моменты:
- Эффективные линейные слои с хранением параметров на CPU
- Асинхронные CUDA потоки для минимизации задержек
- Поддержка оптимизатора ZeRO-1 для распределенного обучения
- Совместимость с существующим кодом PyTorch

📌 GitHub: https://github.com/lodestone-rock/RamTorch

#python

GitHub

GitHub - lodestone-rock/RamTorch: RAM is all you need

RAM is all you need. Contribute to lodestone-rock/RamTorch development by creating an account on GitHub.

❤8🔥7👍1

5.09K views12:40

Анализ данных (Data analysis)

⚡ Это прорыв!

Команда UCLA создала оптическую генеративную модель, которая работает на свете, а не на GPU.

В демонстрации шум сначала кодируется в фазовые паттерны с помощью лёгкого энкодера, а затем свободное распространение света (оптический декодер) превращает их в изображения, цифры, одежду, бабочек, лица и даже картины в стиле Ван Гога.

🔥 Главное - во время генерации нет никакой вычислительной нагрузки.

Результаты сопоставимы с цифровыми диффузионными моделями и открывают путь к сверхбыстрому и энергоэффективному ИИ на фотонике.

📄 Paper (Nature): https://nature.com/articles/s41586-025-09446-5#MOESM1

❤29🔥13👍3👏1

5.9K views14:47

Анализ данных (Data analysis)

Forwarded from Machinelearning

✔️ Прорыв в квантовых вычислениях

Физики Гарварда создали первый в мире квантовый компьютер, который работает непрерывно без перезапуска.

Ранее квантовые машины держались миллисекунды, максимум - около 13 секунд.
Новая установка работает более 2 часов и может функционировать бесконечно.

Ключевое новшество - решение проблемы потери атомов: система в реальном времени пополняет кубиты, впрыскивая 300 000 атомов в секунду с помощью оптических инструментов.

Учёные считают, что практические, постоянно работающие квантовые компьютеры могут появиться уже в течение 2 лет - с огромным влиянием на медицину, финансы и научные исследования.
thecrimson

✔️ Anthropic делает ставку на AI-приложения для бизнеса

По данным The Information, Anthropic продвигает свою модель Claude как основу для создания enterprise-замен привычных приложений вроде Slack. Компания делает ставку на обучение с подкреплением, чтобы улучшить способности модели к программированию.

Похожую стратегию развивает и xAI Илона Маска, но эксперты сомневаются, что крупные корпорации откажутся от укоренившихся систем вроде SAP или ServiceNow. Более вероятно, что первыми такие AI-first инструменты начнут использовать небольшие стартапы.

Тем временем JPMorgan и другие банки активно заявляют об интеграции решений OpenAI, Anthropic и Google, хотя реальные масштабы затрат пока не соответствуют публичному энтузиазму.
theinformation

✔️ Perplexity объявила, что её AI-браузер Comet, ранее доступный только по подписке $200/месяц, теперь стал бесплатным для всех (с ограничениями по запросам).

Comet, запущенный в июле 2025 года, работает как встроенный ассистент: он умеет анализировать страницы, вытаскивать ключевые детали и сердить по ссылкам, проводя многошаговые исследования.

Perplexity также представила Comet Plus за $5 — партнёрскую подписку, которая открывает доступ к контенту от CNN, The Washington Post, Fortune, Los Angeles Times и Condé Nast (The New Yorker, Wired и др.).

Однако запуск совпал с продолжающимися исками от крупных издателей, включая Dow Jones (The Wall Street Journal) и New York Post, обвиняющих стартап в использовании их материалов для обучения ИИ.
Скачать Comet

✔️ OpenAI раскалывает запуск Sora: ИИ-видео как TikTok, но сотрудники бьют тревогу

TechCrunch пишет, что запуск нового соцприложения Sora 2 вызвал тревогу внутри самой OpenAI. Это TikTok-подобная лента, наполненная видео, созданными ИИ, включая дипфейки самого Сэма Альтмана.

Часть исследователей OpenAI считает, что компания уходит от своей миссии ради хайпового контента. Один из сотрудников прямо заявил: «AI-ленты - пугающие. Я был шокирован, узнав, что мы выпускаем Sora 2…»

Сторонники проекта объясняют, что такие продукты нужны, чтобы финансировать фундаментальные исследования и дать пользователям почувствовать силу технологий. В OpenAI утверждают, что хотят «показать людям что-то классное, чтобы они улыбнулись».

Но вместе с ростом Sora OpenAI рискует повторить судьбу классических соцсетей: зависимость, манипуляции c информацией, проблемы с дипфейками и давлением на метрики вовлечённости.
techcrunch

✔️ США продолжают контролировать большинство мировых мощностей для обучения ИИ, строя самые большие и энергоемкие кластеры

Китай в 2025 году вложит до 98 млрд долларов, но экспортные ограничения на топовые чипы Nvidia и AMD тормозят прогресс.

Huawei продвигает Ascend 910C, однако по памяти, пропускной способности и софту он уступает решениям Nvidia. США разрешили ограниченные продажи H20 и MI308 в Китай с 15% налогом, но топовые GPU недоступны китацы, и разрыв в производительности всё ещё в пользу американцев.
X

@ai_machinelearning_big_data

#news #ai #ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤5👍3🔥2🥰2🤣1

3.36K views07:46

Анализ данных (Data analysis)

🚀 IBM Granite 4.0 теперь доступен в Unsloth

🧩 Модель в формате GGUF с гибридной архитектурой (Hybrid Mamba) — сочетание плотных слоёв и MoE для ускорения и снижения памяти.

⚡ Основные факты:
- Доступные размеры: Micro (3B), Tiny (7B/1B активный), Small (32B/9B активный).
- Контекст до 128K токенов.
- Тренировка в Unsloth до 2× быстрее и требует на 50% меньше VRAM.
- Поддержка Ollama, llama.cpp и Docker для лёгкого запуска.

🎯 Где полезно: чат-боты, edge-развёртывания, длинные документы, кастомизация через fine-tuning.

Подробнее: https://docs.unsloth.ai/new/ibm-granite-4.0
Hf: https://huggingface.co/collections/unsloth/granite-40-68ddf64b4a8717dc22a9322d

❤5👍4🔥1

4.91K views11:04

Анализ данных (Data analysis)

2:52

This media is not supported in your browser

VIEW IN TELEGRAM

💡 Модель Ming-UniAudio — это универсальный фреймворк, сочетающий понимание речи, генерацию и редактирование.

- Модель Ming-UniAudio — это универсальный фреймворк, сочетающий *понимание речи*, *генерацию* и *редактирование*.
- В её основе лежит единый непрерывный токенизатор речи, интегрирующий семантические и акустические признаки.
- Поддерживается инструкционное редактирование: можно менять звук, содержание или тональность без указания временных фрагментов.
- В бенчмарках показывает конкурентные результаты и для распознавания, и для генерации речи.
- Лицензия: Apache-2.0.

💻 GitHub: https://github.com/inclusionAI/Ming-UniAudio
🤗 Tokenizer: https://huggingface.co/inclusionAI/MingTok-Audio
🤗 Model:
base: https://huggingface.co/inclusionAI/Ming-UniAudio-16B-A3B
edit: https://huggingface.co/inclusionAI/Ming-UniAudio-16B-A3B-Edit
🤗 Benchmark: https://huggingface.co/datasets/inclusionAI/Ming-Freeform-Audio-Edit-Benchmark
🌍 blog: https://xqacmer.github.io/Ming-Unitok-Audio.github.io/
#AI #Speech #SpeechLLM #LLM #GenerativeAI #Audio #ASR #TTS #SpeechEditing

❤8🔥3👍2

4.91K views11:25

Анализ данных (Data analysis)

💾 Генеральный директор Western Digital заявил, что жёсткие диски остаются центральным элементом хранения данных для ИИ: примерно 80% данных гиперскейлеров хранятся на HDD, 10% — на SSD и ещё 10% — на лентах.

Такое распределение объясняется экономикой и энергопотреблением: диски примерно в 5–6 раз дешевле SSD при больших объёмах и потребляют меньше ватт на терабайт.

В дата-центрах данные распределяют по уровням: «горячие» — на флэше, «тёплые и холодные» — на HDD, архивные — на ленте. Это оптимальный баланс стоимости и производительности.

Однако спрос на хранение для ИИ настолько вырос, что производители не успевают удовлетворять рынок: время ожидания дисков сверхвысокой ёмкости (32 ТБ+) растягивается от нескольких месяцев до года.

pcguide.com/news/hard-drives-far-from-obsolete-says-western-digital-ceo-and-ai-is-one-big-reason-why/

🔥11❤8👍4

4.99K views15:19

Анализ данных (Data analysis)

⚡️ Модель ModernVBERT с 250 млн параметров показывает результаты, сопоставимые или превосходящие модели, которые в 10 раз больше, в задачах поиска по документам.

Модель лидирует среди моделей до 1 млрд параметров и кодирует запросы в 7 раз быстрее на обычных CPU.

В отличие от декодеров, которые читают текст слева направо и не могут пересматривать ранние токены, ModernVBERT использует двунаправленный текстовый энкодер, обученный на маскировании слов, и небольшой визуальный модуль.

Каждое изображение страницы разбивается на патчи, которые отображаются в то же пространство, что и текст, а затем объединяются с токенами слов.

Механизм позднего взаимодействия (late interaction) сохраняет векторы всех токенов, позволяя каждому токену запроса находить наиболее точное соответствие. Эта комбинация двунаправленного внимания и позднего взаимодействия превосходит декодерные архитектуры при извлечении документов.

Более высокое разрешение страниц и короткая «high-resolution cooldown» фаза повышают точность поиска, хотя могут ухудшить работу с обычными изображениями. Добавление пар «только текст» в контрастивное обучение помогает модели эффективно объединять текстовое и визуальное пространство.

ColModernVBERT - остаётся компактной, демонстрирует высокие показатели на бенчмарках и работает эффективно даже на стандартных CPU.

Интересное чтиво: https://arxiv.org/abs/2510.01149

Please open Telegram to view this post

VIEW IN TELEGRAM

❤10🔥8👍5

4.9K views10:54

About

Blog

Apps

Platform