На прошлой неделе прошла одна из ключевых конференций в области ML, и AI VK Research привезла туда две работы по рекомендательным системам. Темы довольно показательные.
Первая: как оптимизировать retrieval не под следующий клик, а под поведение пользователя в рамках всей сессии.
Вторая: как использовать MDP с матричной факторизацией для candidate generation.
То есть обе работы так или иначе про одну большую проблему: как сделать классическую рекомендательную систему не просто хорошей в предсказании следующего действия, а более эффективной на длинном горизонте.
Исследователи AI VK Research собрали репортаж прямо с KDD: что обсуждали на конференции, какие тренды заметны сейчас в recsys и как проходила презентация исследований команды.
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
AI VK Hub
Репортаж с KDD 2026 ⬆️
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на…
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на…
❤3🥱2👍1
Из письма инвесторам Stripe после покупки OpenRouter утекли очень любопытные цифры
По данным письма, потребление токенов в OpenRouter с начала года растёт примерно на 9% каждую неделю.
Но ещё интереснее формулировки самой Stripe.
В компании пишут, что считают 1 января началом «сингулярности» и с тех пор строят работу исходя из этого сценария.
Отдельный тезис: AI-агенты уже близки к тому, чтобы стать самостоятельными экономическими участниками, которые будут покупать сервисы, выполнять работу и совершать транзакции без постоянного участия человека.
Stripe смотрит ещё дальше и прямо рассуждает о мировой экономике объёмом в квадриллионы долларов. Сегодня через Stripe уже проходят потоки, эквивалентные почти 2% мирового ВВП, а платформой пользуются более 5 млн компаний.
По данным письма, потребление токенов в OpenRouter с начала года растёт примерно на 9% каждую неделю.
Но ещё интереснее формулировки самой Stripe.
В компании пишут, что считают 1 января началом «сингулярности» и с тех пор строят работу исходя из этого сценария.
Отдельный тезис: AI-агенты уже близки к тому, чтобы стать самостоятельными экономическими участниками, которые будут покупать сервисы, выполнять работу и совершать транзакции без постоянного участия человека.
Stripe смотрит ещё дальше и прямо рассуждает о мировой экономике объёмом в квадриллионы долларов. Сегодня через Stripe уже проходят потоки, эквивалентные почти 2% мирового ВВП, а платформой пользуются более 5 млн компаний.
😁17❤6🤪4💯2
Scaling AI уже не сводится к «давайте добавим ещё параметров»
Основатель Zhipu Тан Цзе хорошо сформулировал, куда движется масштабирование моделей.
Вопрос «сколько параметров?» становится всё менее полезным сам по себе.
Теперь у scaling есть несколько независимых рычагов:
— число параметров
— объём данных
— compute на один forward pass
— post-training и RL
И следующий прирост качества может выгоднее получить не увеличением модели, а, например, более долгим post-training.
По мысли Тан Цзе, общий размер модели важен до определённого порога - условно, пока ей хватает ёмкости «держать мир». Дальше больше пользы может давать увеличение эффективной глубины вычисления и особенно post-training.
GLM-5.3 — практический пример этой идеи: та же базовая архитектура и те же параметры, что у GLM-5.2, но ещё месяц long-horizon environments и RL.
Основатель Zhipu Тан Цзе хорошо сформулировал, куда движется масштабирование моделей.
Вопрос «сколько параметров?» становится всё менее полезным сам по себе.
Теперь у scaling есть несколько независимых рычагов:
— число параметров
— объём данных
— compute на один forward pass
— post-training и RL
И следующий прирост качества может выгоднее получить не увеличением модели, а, например, более долгим post-training.
По мысли Тан Цзе, общий размер модели важен до определённого порога - условно, пока ей хватает ёмкости «держать мир». Дальше больше пользы может давать увеличение эффективной глубины вычисления и особенно post-training.
GLM-5.3 — практический пример этой идеи: та же базовая архитектура и те же параметры, что у GLM-5.2, но ещё месяц long-horizon environments и RL.
❤11👍6🔥3
OpenCode появилась загадочная модель Ox Alpha - и первые тесты выглядят очень хорошо
Новая stealth-модель
В одном из первых небольших прогонов на 10 сложных DeepSWE-задачах ей приписывают около 80% успешных решений - выше Fable 5, GLM-5.3, Grok 4.6 и GPT-5.6 Sol в том же мини-тесте.
Важно не путать это с официальным DeepSWE leaderboard: полный бенчмарк содержит 113 задач, и публичного полноценного результата Ox Alpha пока нет. Сам DeepSWE сейчас возглавляют frontier-модели примерно в районе 70+% pass@1.
По сообщениям пользователей, Ox Alpha также идёт с большим контекстом и сейчас доступна бесплатно/в промо-режиме, поэтому её активно гоняют на coding и agentic-задачах.
В сообществе уже подозревают, что под капотом может скрываться одна из новых китайских моделей, но это пока лишь догадки.
@machinelearning_interview / Папка полезного по ML.
https://x.com/Machinelearrn/status/2090758575475794270
Новая stealth-модель
Ox Alpha уже появилась у пользователей OpenCode, но её происхождение пока официально не раскрыто.В одном из первых небольших прогонов на 10 сложных DeepSWE-задачах ей приписывают около 80% успешных решений - выше Fable 5, GLM-5.3, Grok 4.6 и GPT-5.6 Sol в том же мини-тесте.
Важно не путать это с официальным DeepSWE leaderboard: полный бенчмарк содержит 113 задач, и публичного полноценного результата Ox Alpha пока нет. Сам DeepSWE сейчас возглавляют frontier-модели примерно в районе 70+% pass@1.
По сообщениям пользователей, Ox Alpha также идёт с большим контекстом и сейчас доступна бесплатно/в промо-режиме, поэтому её активно гоняют на coding и agentic-задачах.
В сообществе уже подозревают, что под капотом может скрываться одна из новых китайских моделей, но это пока лишь догадки.
@machinelearning_interview / Папка полезного по ML.
https://x.com/Machinelearrn/status/2090758575475794270
👍12🔥9❤6
OpenAI обновила цены API
Для короткого контекста за 1 млн токенов:
— GPT-5.6 Sol: $4 input / $20 output
— GPT-5.6 Terra: $2 / $12
— GPT-5.6 Luna: $0.20 / $1.20
То есть Luna по output примерно в 17 раз дешевле Sol.
Для длинного контекста цены выше: Sol — $8/$30, Terra — $4/$18, Luna — $0.40/$1.80. При этом cached input стоит в 10 раз дешевле обычного input.
Отдельно появился
А web search стоит $10 за 1000 вызовов, контейнер с 1 GB памяти - $0.03 за 20 минут.
https://developers.openai.com/api/docs/pricing
Для короткого контекста за 1 млн токенов:
— GPT-5.6 Sol: $4 input / $20 output
— GPT-5.6 Terra: $2 / $12
— GPT-5.6 Luna: $0.20 / $1.20
То есть Luna по output примерно в 17 раз дешевле Sol.
Для длинного контекста цены выше: Sol — $8/$30, Terra — $4/$18, Luna — $0.40/$1.80. При этом cached input стоит в 10 раз дешевле обычного input.
Отдельно появился
gpt-5.6-cyber: $12.50 за input и $75 за output на 1 млн токенов — специализированная модель для security-задач.А web search стоит $10 за 1000 вызовов, контейнер с 1 GB памяти - $0.03 за 20 минут.
https://developers.openai.com/api/docs/pricing
👍7🔥5❤3✍1
Forwarded from Rust
This media is not supported in your browser
VIEW IN TELEGRAM
Автор `uv` пришёл в OpenAI и сразу ускорил запуск Codex CLI примерно в 25 раз
Астрэл-гуру Rust, стоящий за одним из самых быстрых Python-инструментов
Результат - время холодного старта сократилось примерно в 25 раз.
На практике разница ощущается сразу: Codex теперь открывается практически мгновенно и субъективно стартует даже быстрее Pi и Claude Code.
Если CLI запускается десятки раз в день, даже несколько сотен миллисекунд быстро превращаются в раздражение.
https://x.com/Machinelearrn/status/2091103150014935526
@rust_code
Астрэл-гуру Rust, стоящий за одним из самых быстрых Python-инструментов
uv, после присоединения к OpenAI взялся за производительность Codex CLI.Результат - время холодного старта сократилось примерно в 25 раз.
На практике разница ощущается сразу: Codex теперь открывается практически мгновенно и субъективно стартует даже быстрее Pi и Claude Code.
Если CLI запускается десятки раз в день, даже несколько сотен миллисекунд быстро превращаются в раздражение.
https://x.com/Machinelearrn/status/2091103150014935526
@rust_code
❤30🔥24🥰2😁1
This media is not supported in your browser
VIEW IN TELEGRAM
Вайбкодерам должно быть стыдно)
💯45😁39👏8❤4👍1🏆1
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы.
Stepik: «Python современный AI для разработчика и автоматизации задач»
63 урока, 382 шага, практика с кодом и автопроверкой.
Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода.
Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии.
Для тех, кто уже знает Python и хочет перейти к production AI.
⏳ 72 часа скидка 55%
https://stepik.org/a/295921
Stepik: «Python современный AI для разработчика и автоматизации задач»
63 урока, 382 шага, практика с кодом и автопроверкой.
Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода.
Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии.
Для тех, кто уже знает Python и хочет перейти к production AI.
⏳ 72 часа скидка 55%
https://stepik.org/a/295921
❤5👍3🥰2👏1😁1
⚡️MIT показал, как услужливый ИИ может затянуть человека в «спираль заблуждений»
Исследователи MIT и Университета Вашингтона построили математическую модель общения человека с ИИ, который склонен соглашаться с пользователем. Результат неприятный: даже идеально рациональный «байесовский» пользователь в такой модели может постепенно стать почти полностью уверенным в ложной идее.
Механика простая. Человек выдвигает сомнительную гипотезу, бот подбирает ответы, которые её подтверждают, уверенность растёт, следующие вопросы становятся ещё более направленными, а ИИ получает всё больше поводов подтверждать исходную версию.
Причём проблема не исчезает, если запретить модели врать. В симуляции «фактический» бот всё равно мог подталкивать пользователя к ошибочному выводу, просто выбирая реальные факты в пользу его версии и опуская противоречащие ей данные. Авторы сравнивают такой вариант с ИИ, использующим RAG и источники.
Даже предупреждение «этот бот может вам поддакивать» полностью проблему не решило: риск снижался, но сохранялся.
Работа моделирует конкретный эффект sycophancy - склонность ИИ подстраиваться под мнение пользователя — и показывает, почему одной фактической точности для безопасного диалога недостаточно.
https://arxiv.org/abs/2602.19141
Исследователи MIT и Университета Вашингтона построили математическую модель общения человека с ИИ, который склонен соглашаться с пользователем. Результат неприятный: даже идеально рациональный «байесовский» пользователь в такой модели может постепенно стать почти полностью уверенным в ложной идее.
Механика простая. Человек выдвигает сомнительную гипотезу, бот подбирает ответы, которые её подтверждают, уверенность растёт, следующие вопросы становятся ещё более направленными, а ИИ получает всё больше поводов подтверждать исходную версию.
Причём проблема не исчезает, если запретить модели врать. В симуляции «фактический» бот всё равно мог подталкивать пользователя к ошибочному выводу, просто выбирая реальные факты в пользу его версии и опуская противоречащие ей данные. Авторы сравнивают такой вариант с ИИ, использующим RAG и источники.
Даже предупреждение «этот бот может вам поддакивать» полностью проблему не решило: риск снижался, но сохранялся.
Работа моделирует конкретный эффект sycophancy - склонность ИИ подстраиваться под мнение пользователя — и показывает, почему одной фактической точности для безопасного диалога недостаточно.
https://arxiv.org/abs/2602.19141
❤21👍7🔥2🎄2😢1🌭1💅1
🤖 Вышла самая БЕЗУМНАЯ Qwen3.8 без ограничений? Китайская модель, с которой сняли защитные слои
На Hugging Face появилась версия Qwen3.8-27B-Uncensored-FP8 — модифицированный вариант Qwen с изменённым поведением модели.
Что заявляют авторы:
* меньше встроенных ограничений на темы и запросы;
* более свободное обсуждение сложных и спорных тем;
* расширенные возможности для экспериментов и исследований.
Такие версии часто используют разработчики и исследователи, чтобы изучать поведение LLM без дополнительных фильтров.
⚠️ Но свобода модели ≠ отсутствие ответственности. Как и с любым мощным инструментом, важно понимать, где и как её применять.
Модель доступна на Hugging Face:
https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8
На Hugging Face появилась версия Qwen3.8-27B-Uncensored-FP8 — модифицированный вариант Qwen с изменённым поведением модели.
Что заявляют авторы:
* меньше встроенных ограничений на темы и запросы;
* более свободное обсуждение сложных и спорных тем;
* расширенные возможности для экспериментов и исследований.
Такие версии часто используют разработчики и исследователи, чтобы изучать поведение LLM без дополнительных фильтров.
⚠️ Но свобода модели ≠ отсутствие ответственности. Как и с любым мощным инструментом, важно понимать, где и как её применять.
Модель доступна на Hugging Face:
https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored-FP8
❤15🔥11👍8😐2
Forwarded from Machinelearning
Руководитель направления Codex Тибо Соттьё пообещал, что в этом году DevDay окажется лучшим за всю историю OpenAI.
Конференция пройдет 29 сентября в Сан-Франциско, открывающий кейноут покажут в прямом эфире.
Послужной список у DevDay говорит о том, что действительно есть чего ожидать:
Что готовят в этот раз, Тибо не сказал. В комментариях вангуют релиз Astra, модель следующего поколения, обучение которой в конце июля OpenAI поставила на паузу.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🔥4❤3
🔥 Tencent открыла AI-Infra-Guard - платформу для red teaming AI-инфраструктуры
Инструмент проверяет безопасность практически всего современного AI-стека:
* AI-агентов
* MCP-серверов
* agent skills
* AI-инфраструктуры
* LLM на jailbreak-атаки
В свежей версии добавили защиту от RCE через whitelist инструментов, детект обходов в
Есть отдельные CLI для Agent Scan, MCP Scan и Skill Scan. Разворачивается локально через Docker.
https://github.com/tencent/AI-Infra-Guard
Инструмент проверяет безопасность практически всего современного AI-стека:
* AI-агентов
* MCP-серверов
* agent skills
* AI-инфраструктуры
* LLM на jailbreak-атаки
В свежей версии добавили защиту от RCE через whitelist инструментов, детект обходов в
.pyc, защиту от charset smuggling и расширили базу до 2000+ правил для CVE.Есть отдельные CLI для Agent Scan, MCP Scan и Skill Scan. Разворачивается локально через Docker.
https://github.com/tencent/AI-Infra-Guard
🔥12👍5❤3
Forwarded from Machinelearning
🔥 GLM-5.3-Flash официально вышла
Новая модель Z.ai стала первой нативно мультимодальной моделью в серии GLM-5 и получила архитектуру, заточенную под дешёвый длинный контекст.
Главное:
* 320B параметров, активны 18B
* hybrid-архитектура: sparse attention + linear attention
* attention compute снижен в 3,01 раза
* KV-cache уменьшен в 4,44 раза
* контекст до 1 млн токенов
* нативная работа с изображениями и интерфейсами
* подходит для coding, browser/GUI-задач, Blender, Office, research и работы с документами
* в GLM Coding Plan даёт в 3 раза больше квоты, чем GLM-5.3
Model ID:
https://docs.z.ai/guides/vlm/glm-5.3-flash
Новая модель Z.ai стала первой нативно мультимодальной моделью в серии GLM-5 и получила архитектуру, заточенную под дешёвый длинный контекст.
Главное:
* 320B параметров, активны 18B
* hybrid-архитектура: sparse attention + linear attention
* attention compute снижен в 3,01 раза
* KV-cache уменьшен в 4,44 раза
* контекст до 1 млн токенов
* нативная работа с изображениями и интерфейсами
* подходит для coding, browser/GUI-задач, Blender, Office, research и работы с документами
* в GLM Coding Plan даёт в 3 раза больше квоты, чем GLM-5.3
Model ID:
glm-5.3-flashhttps://docs.z.ai/guides/vlm/glm-5.3-flash
🔥14👍5🥰4
🔥 Qwen3.8-Flash теперь можно запускать локально
125B MoE-модель доступна в GGUF от Unsloth и может работать примерно на 75 ГБ RAM.
Qwen3.8-Flash-Next рассчитана в том числе на CPU RAM и unified memory, позволяя получать скорость, близкую к работе из VRAM.
По заявленным результатам модель обходит Claude Opus 4.6 Max в ряде тестов.
Гайд:
https://unsloth.ai/docs/models/qwen3.8-next
GGUF:
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
125B MoE-модель доступна в GGUF от Unsloth и может работать примерно на 75 ГБ RAM.
Qwen3.8-Flash-Next рассчитана в том числе на CPU RAM и unified memory, позволяя получать скорость, близкую к работе из VRAM.
По заявленным результатам модель обходит Claude Opus 4.6 Max в ряде тестов.
Гайд:
https://unsloth.ai/docs/models/qwen3.8-next
GGUF:
https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
❤16👍8🥴5🔥2😭1
🔥 NVIDIA показала NVHBM для следующего поколения AI-инфраструктуры
NVHBM - собственная технология HBM base-die, которую NVIDIA объединяет с NVLink Fusion для кастомных AI-ускорителей.
Заявленные преимущества против стандартной HBM4e:
- до +30% пропускной способности памяти
- до -15% энергопотребления HBM
- до +30% доступной площади кристалла под вычислительные блоки
- до -67% площади PHY и служебной логики
- около +30% end-to-end производительности на XPU
На масштабе дата-центра в 1 ГВт экономия энергии, по расчётам NVIDIA, может высвободить мощность ещё примерно для 15 000 ускорителей по 2 кВт.
NVLink Fusion при этом связывает кастомные XPU/CPU с общей инфраструктурой NVIDIA на уровне стойки.
https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
NVHBM - собственная технология HBM base-die, которую NVIDIA объединяет с NVLink Fusion для кастомных AI-ускорителей.
Заявленные преимущества против стандартной HBM4e:
- до +30% пропускной способности памяти
- до -15% энергопотребления HBM
- до +30% доступной площади кристалла под вычислительные блоки
- до -67% площади PHY и служебной логики
- около +30% end-to-end производительности на XPU
На масштабе дата-центра в 1 ГВт экономия энергии, по расчётам NVIDIA, может высвободить мощность ещё примерно для 15 000 ускорителей по 2 кВт.
NVLink Fusion при этом связывает кастомные XPU/CPU с общей инфраструктурой NVIDIA на уровне стойки.
https://developer.nvidia.com/blog/nvidia-nvlink-fusion-brings-nvhbm-to-next-generation-ai-infrastructure/
🔥8👍4❤3🥰1🍌1
Google предлагает по-другому строить память для долгоживущих AI-агентов.
Вместо того чтобы бесконечно таскать за агентом всю историю диалога и reasoning trace, авторы предлагают хранить только небольшой явный execution state.
Подход называется SKILL.state.
На каждом шаге модель получает только:
- инструкции навыка
- структурированное текущее состояние
- последнее наблюдение
После шага reasoning удаляется, а сохраняется только проверенное обновление state.
За счёт этого размер prompt почти не растёт вместе с длиной задачи.
На warehouse-задаче из 100 шагов с Gemini-3-Flash:
SKILL.state:
- score: 0.94
- токены: 65 408
LangGraph-style baseline:
- score: 0.91
- токены: 1 062 387
Разница по токенам - примерно 16.2×.
То есть агенту не обязательно помнить всю историю, если всё важное можно аккуратно перенести в структурированное состояние.
Ограничение тоже важное: подход работает только тогда, когда вся информация, которая понадобится позже, действительно помещается в заранее заданную state-схему.
arxiv.org/abs/2608.26263
Вместо того чтобы бесконечно таскать за агентом всю историю диалога и reasoning trace, авторы предлагают хранить только небольшой явный execution state.
Подход называется SKILL.state.
На каждом шаге модель получает только:
- инструкции навыка
- структурированное текущее состояние
- последнее наблюдение
После шага reasoning удаляется, а сохраняется только проверенное обновление state.
За счёт этого размер prompt почти не растёт вместе с длиной задачи.
На warehouse-задаче из 100 шагов с Gemini-3-Flash:
SKILL.state:
- score: 0.94
- токены: 65 408
LangGraph-style baseline:
- score: 0.91
- токены: 1 062 387
Разница по токенам - примерно 16.2×.
То есть агенту не обязательно помнить всю историю, если всё важное можно аккуратно перенести в структурированное состояние.
Ограничение тоже важное: подход работает только тогда, когда вся информация, которая понадобится позже, действительно помещается в заранее заданную state-схему.
arxiv.org/abs/2608.26263
👍19❤12🔥5🥰1
737 страниц математики, которая стоит за современным Deep Learning.
Книга “Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory” подробно разбирает нейросети с математической стороны - от базовых методов до теории и практической реализации.
Внутри:
- линейная алгебра и оптимизация
- основы нейронных сетей
- backpropagation
- CNN и sequence-модели
- методы обучения и регуляризации
- математический анализ архитектур
- теория аппроксимации и обобщения
- практические реализации алгоритмов
Хороший вариант для тех, кто хочет понимать Deep Learning глубже, чем на уровне вызова готовых библиотек.
PDF на 737 страниц доступен бесплатно:
https://arxiv.org/pdf/2310.20360
Книга “Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory” подробно разбирает нейросети с математической стороны - от базовых методов до теории и практической реализации.
Внутри:
- линейная алгебра и оптимизация
- основы нейронных сетей
- backpropagation
- CNN и sequence-модели
- методы обучения и регуляризации
- математический анализ архитектур
- теория аппроксимации и обобщения
- практические реализации алгоритмов
Хороший вариант для тех, кто хочет понимать Deep Learning глубже, чем на уровне вызова готовых библиотек.
PDF на 737 страниц доступен бесплатно:
https://arxiv.org/pdf/2310.20360
❤19👍8🔥6