Data Science. SQL hub
36K subscribers
1.18K photos
99 videos
37 files
1.19K links
По всем вопросам- @workakkk

@itchannels_telegram - 🔥лучшие ит-каналы

@ai_machinelearning_big_data - Machine learning

@pythonl - Python

@pythonlbooks- python книги📚

@datascienceiot - ml книги📚

РКН: https://vk.cc/cIi9vo

#VRHSZ
Download Telegram
Участвуй во всероссийском ИТ-чемпионате МТС True Tech Champ 2026 c призовой фондом 10 250 000 рублей.

Если тебе нравятся алгоритмы, структуры данных и задачи на чистую логику — участвуй в алгоритмическом треке с индивидуальным зачетом.

Решай задачи разного уровня сложности: от базовых до тех, что проверяют скорость мышления и умение оптимизировать решения за ограниченное время.

В финале лучшие 120 участников алгоритмического трека сразятся в лайв-кодинге за шесть призовых мест и 2 750 000 рублей. Всех финалистов ждут:
— Лимитированный мерч;
— Сертификаты об участии;
— Масштабное мероприятие с выступлениями хэдлайнеров и фестивальными активностями.

Успей зарегистрироваться и пройти отборочный этап до 27 сентября.

Erid: 2VSb5xkQt6E
👍3👏1🤬1
🔥 PostgreSQL 19 задерживается релиз может сдвинуться на несколько недель или даже месяцев.

Причина не в одной критической ошибке, а в масштабе переработок. После начала бета-тестирования из PostgreSQL 19 уже откатили 53 изменения, включая несколько заметных функций.

Из релиза убрали SQL/PGQ для графовых запросов, GROUP BY ALL, объединение и разделение партиций через ALTER TABLE, онлайн-переключение checksums, часть изменений JSON_TABLE и новые возможности pg_stat_statements. Большинство этих функций теперь, вероятно, вернутся уже в PostgreSQL 20.

При этом в PostgreSQL 19 пока остаются pg_plan_advice, parallel autovacuum, ON CONFLICT DO SELECT, IGNORE NULLS для оконных функций и ряд улучшений логической репликации.

Отдельная причина большого числа поздних откатов — более глубокое тестирование кода. Разработчики всё активнее используют AI-инструменты для поиска ошибок и генерации воспроизводимых тестов, из-за чего проблемы находят уже после попадания изменений в ветку релиза.

Следующая Beta 4 запланирована на 24 сентября 2026 года. Для production Snowflake пока рекомендует ориентироваться на PostgreSQL 18.

https://www.snowflake.com/en/blog/engineering/postgresql-19-release-delay-feature-reverts/
👍5
🧩 Сложная SQL-задача: симуляция DNS-кеша

Есть таблица запросов:


CREATE TABLE dns_requests (
request_id BIGINT PRIMARY KEY,
requested_at TIMESTAMP,
node_id INT,
domain TEXT,
record_type TEXT,
ttl_seconds INT
);


Правила:

• Ключ кеша: node_id + domain + record_type.
• Первый запрос - MISS, он создаёт запись в кеше.
• Запись действует до requested_at + ttl_seconds.
• Запрос в момент истечения TTL — уже MISS.
• HIT не обновляет TTL.
• Новый MISS заменяет старую запись.
При одинаковом времени порядок задаёт request_id.

Напишите один SQL-запрос, который вернёт:


request_id
cache_status -- HIT / MISS
cache_loaded_at
cache_expires_at
source_request_id -- какой MISS создал запись


Главная ловушка: ttl_seconds у HIT использовать нельзя — срок жизни определяется последним MISS.

Дополнительно посчитайте для каждого узла процент запросов, обработанных локально, и количество обращений к CoreDNS.

Условия: PostgreSQL, без процедур, циклов и временных таблиц.
👍4❤3
Объектное хранилище в эпоху быстрых данных

Объём данных, с которыми нужно работать, растёт ежедневно. Стандартных решений уже не хватает для задач ИИ и аналитики. Большие объёмы данных нужно не только хранить, но и быстро записывать и читать.

В MWS Cloud Platform мы построили объектное хранилище не только на привычных HDD-дисках, но и на NVMe. На вебинаре покажем, какие сценарии работы это открывает и как меняет привычные подходы.

Подключайтесь! Обсудим:
✅ Чем классы хранения MWS Object Storage отличаются от привычных
✅ В каких сценариях новый тёплый класс проявляет себя лучше всего
✅ Преимущества и слабые места в разных сценариях работы

📆 7 октября в 14:00 (мск)

Зарегистрироваться
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1
Forwarded from Machinelearning
🌟 Samsone: открытые аудиоязыковые модели для смартфонов

Samsung опубликовали Samsone - семейство из трёх небольших аудиоязыковых моделей для работы на мобильных устройствах: Samsone-99M, Samsone-134M и Samsone-356M.

Проект будет участвовать в конференции Interspeech 2026, которая пройдет с 27 сентября по 1 октября в Сиднее.


Модели принимают один или несколько аудиофрагментов вместе с текстовым запросом и отвечают текстом: описывают звук, отвечают на вопросы о записи, сравнивают клипы между собой.

Заявлено понимание речи, музыки и звуки окружения. Отвечают модели только по-английски и строчными буквами - ради экономии параметров оставили в обучающих текстах только строчные символы ASCII и вычистили из словаря редкие токены.

Авторы предупреждают, что после дообучения на аудиовопросах модели теряют общие языковые навыки, так что это точечный инструмент, а не полноценный собеседник.

🟡Архитектура

Аудиоэнкодер Whisper-Tiny на 9 млн параметров, нелинейный проектор в пространство текстовых эмбеддингов и языковая модель SmolLM2 от Hugging Face на 135 или 360 млн параметров.

Каждый клип усредняется до 50 аудиотокенов, а разделитель SEP отделяет клипы друг от друга и от текста, поэтому аудио можно вставлять в любое место запроса.

🟡Тесты

На MMAU (10 тысяч вопросов о звуках, музыке и речи) Samsone-134M набирает 61,33% против 53,34% у прежнего лидера среди малых моделей Mellow на 167 млн параметров.

Это выше Qwen2-Audio-Instruct на 8,4 млрд параметров (57,4%) и на уровне Audio Flamingo 2 на 3 млрд (61,06%).


На речевой части результаты хуже. В более сложном MMAU-Pro расзница с Mellow составляет 10 пп (37,57% против 27,5%), здесь впереди Qwen2-Audio (45,41%) и GPT-4o Audio (52,5%).

На Galaxy S25 Ultra без аппаратных оптимизаций Samsone-99M генерирует 125 токенов в секунду, Samsone-134M - 87, Samsone-356M - 39.

Обработка аудио перед генерацией занимает от 0,7 до 1,1 секунды.

Веса для PyTorch, код обучения и экспорта, а также Android-приложение под Android 12 и новее выложены в репозитории проекта.


🟡Веса
🟡Arxiv
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #SALM #Samsone #Samsung
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1🔥1👏1
⚡️ SQL-задача с опасным подвохом

Какой баланс получит аккаунт после выполнения запроса в PostgreSQL?


CREATE TABLE accounts (
id int PRIMARY KEY,
balance int
);

CREATE TABLE operations (
account_id int,
amount int
);

INSERT INTO accounts VALUES (1, 100);
INSERT INTO operations VALUES
(1, 10),
(1, 20);

UPDATE accounts a
SET balance = a.balance + o.amount
FROM operations o
WHERE o.account_id = a.id;


Многие ответят 130, но PostgreSQL обновит строку только один раз.

Результатом может стать 110 или 120. Если целевая строка соединяется с несколькими строками из FROM, PostgreSQL использует одну из них, но какую именно, не гарантируется.

Правильный вариант:


UPDATE accounts a
SET balance = a.balance + x.total
FROM (
SELECT account_id, SUM(amount) AS total
FROM operations
GROUP BY account_id
) x
WHERE x.account_id = a.id;


Теперь каждой строке accounts соответствует ровно одна строка источника, а баланс станет 130.

#SQL #PostgreSQL #Database
👍13❤3🥰2
🔥Один слой данных вместо цепочки копий между системами

В традиционной аналитической инфраструктуре результаты обработки приходится переносить между хранилищем, SQL-системой и BI. Вместе с каждой копией появляется новая задача: ее нужно обновлять, сверять с исходными данными и учитывать в правилах доступа.

В DataLens Platform разные инструменты работают с общей основой данных. Lakehouse построен на S3 и Apache Iceberg. Trino используется для интерактивных SQL-запросов, Spark — для ресурсоемкой обработки, Airflow — для управления процессами.

Единый каталог метаданных показывает происхождение данных и их использование. Общая модель доступа действует на уровне всей платформы.

Так компания сокращает количество переносов между системами, а результаты подготовки данных можно повторно использовать в SQL-запросах, отчетах и ИИ-сценариях.

📎 Подробнее о DataLens Platform — в материале СМИ.
Media is too big
VIEW IN TELEGRAM
Softmax простыми словами: что значат 66,5% в ответе нейросети?

Softmax простыми словами: ChatGPT выдаёт не ответы, а вероятности следующих токенов, и 66,5% означают только то, что такое продолжение текста самое вероятное.

Модель может звучать уверенно и при этом ошибаться, потому что вероятность токена это не вероятность правды. Разбираем на деле Киры, как проверять ответы ИИ через источники и контекст.
❤1👍1🔥1
Тысячи ИИ-агентов одновременно читают продакшен-базу. Что происходит с PostgreSQL?

Google представила PostgreSQL for agents в AlloyDB. Когда нагрузка растёт, система за секунды запускает изолированные экземпляры базы для агентов. Они получают доступ на чтение к актуальным данным, но не конкурируют за вычислительные ресурсы с основной базой. После работы экземпляры масштабируются до нуля.

Агентам доступны SQL, индексы, векторный и полнотекстовый поиск. Идея в том, чтобы они могли исследовать свежие данные и выполнять множество запросов, не замедляя транзакции пользователей.

Статус: Preview, доступ предоставляется по запросу.

Анонс Google Cloud - https://cloud.google.com/blog/products/databases/announcing-postgresql-for-agents-in-alloydb
🔥4❤2👍1
💀 Claude Code за 103 секунды удалил более 48 тысяч файлов

Пользователь Claude Code сообщил о серьёзном инциденте: AI-агент якобы удалил 48 218 файлов рабочего проекта и уничтожил часть Git-репозитория.

Что произошло:

- агенту поручили пересобрать mirror проекта;
- он написал Python-скрипт для удаления старой копии;
- в Windows-каталоге находились directory junctions, ведущие обратно в рабочее дерево;
- проверка ссылок сработала не так, как ожидалось;
- скрипт начал удалять уже реальные файлы проекта.

В результате были очищены .git/objects, refs и logs, поэтому восстановление через обычный Git оказалось невозможно.

Checkpoint Claude Code здесь не обязательно спасает, потому что изменения, сделанные через Bash/PowerShell, могут не попадать в механизм rewind.

Источник:
https://cybersecuritynews.com/claude-code-agent-file-deletion/
😁14❤3🥰2🔥1👏1
⚡️ Запустили PostgreSQL в Docker и случайно открыли его всей сети?

Команда docker run -p 5432:5432 ... по умолчанию публикует порт на всех сетевых интерфейсах хоста. На Linux правило UFW, закрывающее порт, может не помочь: Docker направляет трафик к контейнеру до обработки правил UFW.

Если доступ нужен только с самого сервера, укажите адрес явно:


docker run -p 127.0.0.1:5432:5432 ...


Для всех контейнеров можно изменить адрес привязки по умолчанию в настройках Docker. Но самый простой способ избежать сюрприза - всегда проверять, на каком адресе опубликован порт.

Документация Docker - https://docs.docker.com/engine/network/port-publishing/
👍9🔥1
🔥Полноценный data stack внутри своего контура

Когда данных становится много, одного SQL-движка или отдельной СУБД уже недостаточно. Нужна связка инструментов, которая закрывает весь путь данных: от загрузки и хранения до обработки, аналитики и визуализации.

Такой сценарий можно реализовать в Stackland - платформе, которая разворачивается локально в контуре компании.

В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL - хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage - основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® - управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens - BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.

Для data engineering-команд такой подход интересен прежде всего тем, что можно собрать под одной платформой основные компоненты современного data stack: Storage → SQL → ETL/ELT → DWH/аналитика → BI

И не тратить время на самостоятельную сборку и поддержку каждого компонента с нуля.
❤3👍3
🖥 Vector-базы не умерли, но для многих задач отдельный сервер уже не нужен.
sqlite-vec добавляет vector search прямо в SQLite через компактное расширение.

Что это даёт:
- без Pinecone
- без Weaviate
- без Qdrant
- без отдельного vector DB сервера
- всё хранится рядом с обычными данными в SQLite


Расширение маленькое, open source и запускается везде, где работает SQLite.
Для локальных AI-приложений, RAG, embedded-сценариев и небольших сервисов это особенно интересно: одна база, один файл, обычный SQL + поиск по эмбеддингам.
https://github.com/asg017/sqlite-vec
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7❤1
🗄 ИИ-агент работает с базой, но как не дать ему показать лишнее?

6 октября в Архитектурном клубе Яндекс 360 разберут архитектуру ИИ-агента над корпоративными данными. В том числе поговорят о поиске, метаданных и фильтрах, а главное — о том, как наследовать права доступа исходных систем.

Также Даниил Смирнов, руководитель разработки ИИ-платформы Яндекс 360, расскажет, как изолировать данные пользователей и организаций и не допускать утечек через индекс или кэш..

🗓 6 октября, 17:00 МСК
💻 Онлайн, бесплатно

→ Зарегистрироваться на эфир
❤1👍1
Полезный совет для MySQL 8: используй LATERAL, когда для каждой строки нужно получить «лучшие N связанных записей».
Например, взять последние 3 заказа каждого пользователя:


SELECT
u.id,
u.name,
o.id AS order_id,
o.created_at
FROM users u
JOIN LATERAL (
SELECT id, created_at
FROM orders
WHERE orders.user_id = u.id
ORDER BY created_at DESC
LIMIT 3
) o ON TRUE;


Без LATERAL такую задачу часто решают через оконные функции и сначала ранжируют всю таблицу orders.
С LATERAL база может для каждого пользователя сразу сходить по индексу:


CREATE INDEX idx_orders_user_created
ON orders (user_id, created_at DESC);


Особенно полезно для задач вида:
«последние N», «самая дорогая запись», «ближайшее событие», «лучший результат для каждой строки».
Главное: всегда проверяй EXPLAIN ANALYZE — на больших таблицах правильный составной индекс здесь решает всё.
👍5❤2🔥1
Tencent обошла экспортный запрет США: 100 000 ИИ-чипов в аренду у Oracle

По данным Financial Times, Tencent арендовала у Oracle около 100 000 передовых ИИ-чипов на 5 лет. Сумма сделки около 7 млрд долларов, то есть примерно 14 000 долларов за чип в год.

Сами чипы в Китай не попадают. Они стоят в нескольких дата-центрах Oracle в Юго-Восточной Азии, а Tencent получает к ним доступ удалённо.

Формально это законно. Экспортный контроль США регулирует, куда физически уезжают чипы, а аренда вычислительных мощностей из-за рубежа под ограничения не попадает.

Получается, что ограничения на поставки чипов для китайских компаний во многом работают только на бумаге: железо остаётся за пределами Китая, а модели на нём обучает китайский бигтех. Так что регуляторам, скорее всего, придётся заняться и облачной арендой.

https://www.ft.com/content/8799b33d-f07c-4a03-82f0-bf5d3d1d29e9
❤2👍1🔥1
GitHub представил Agentic Engineering System - фреймворк для команд, которые внедряют AI-агентов в разработку.

Идея простая: больше сгенерированного кода ещё не означает больше пользы.

GitHub предлагает строить работу вокруг трёх вещей:

- Governance — что агентам можно делегировать и где нужен человек
- Shared Knowledge — код, документация, решения, телеметрия и контекст
- Customer Value — приносит ли ускорение реальную пользу пользователям

Сам процесс делится на цикл Define → Deliver → Detect, а человек и AI могут выступать как director, performer или assessor.

Главная метрика: скорость должна расти без роста дефектов и потери качества.

https://github.com/resources/insights/agentic-engineering-system
❤3👍1🔥1
🧠 TIL: SQLite превращает числа в текст сразу по две цифры

Обычно integer → string делают циклом:

/ 10 → берём цифру
% 10 → остаток
и повторяем снова.

SQLite идёт хитрее.

В исходниках есть строка на 200 символов, содержащая все пары от 00 до 99:

000102030405...979899

При преобразовании числа SQLite обрабатывает его по две цифры за раз и просто берёт нужную пару символов по индексу.

То есть вместо множества операций /10 и %10:

делим на 100 → получаем две цифры → копируем готовую пару.

Маленькая оптимизация, но именно из таких деталей и состоит быстрый системный код.

Исходник: sqlite/src/util.c
❤3👍2🔥2