Лето, ИТ-Пикник и музыка известных артистов уже через несколько дней!
8 августа в Коломенском пройдет ИТ-Пикник.
В программе — выступления проекта LAB Антона Беляева, IOWA, Cream Soda, Pompeya, мартина и Совы.
А днем — научпоп-лекции, дискуссии об ИИ и больших языковых моделях, мастер-классы и интерактивы. Полезные знакомства и развлечения тоже будут.
Зарегистрироваться и узнать подробности можно на сайте мероприятия.
В билет входит +1 — можно позвать близких и друзей.
До встречи в месте притяжения ИТ.
8 августа в Коломенском пройдет ИТ-Пикник.
В программе — выступления проекта LAB Антона Беляева, IOWA, Cream Soda, Pompeya, мартина и Совы.
А днем — научпоп-лекции, дискуссии об ИИ и больших языковых моделях, мастер-классы и интерактивы. Полезные знакомства и развлечения тоже будут.
Зарегистрироваться и узнать подробности можно на сайте мероприятия.
В билет входит +1 — можно позвать близких и друзей.
До встречи в месте притяжения ИТ.
👍12
Anthropic ослабила биологические ограничения Fable 5 - ложных блокировок стало на 85% меньше
Anthropic обновила систему защиты Claude Fable 5 для запросов по биологии и медицине.
На старте модель намеренно блокировала почти все биологические запросы: если классификатор видел потенциально рискованную тему, запрос автоматически отправлялся в Opus 5 - менее мощную в этой области модель.
Проблема оказалась в огромном числе ложных срабатываний.
После переработки классификаторов Anthropic заявляет о снижении биологических fallback-переключений примерно на 85%.
Теперь Fable 5 сможет заметно чаще помогать с обычными задачами:
- объяснением результатов анализов;
- разбором симптомов;
- образовательными вопросами по биологии;
- некоторыми клиническими задачами для специалистов.
Но ограничения полностью не исчезли.
Запросы, связанные с профессиональными dual-use направлениями — включая вирусологию, токсикологию и молекулярный дизайн — по-прежнему могут переключаться на Opus 5.
Причина в возможностях самой модели: Anthropic утверждает, что Fable 5 уже превосходит экспертов в отдельных сложных биологических задачах, поэтому слишком свободный доступ к таким возможностям компания считает потенциально опасным.
Интересная цифра: после обновления Anthropic ожидает сокращение общего числа fallback-переключений примерно на 67% в Claude.ai, 55% в Cowork, 17% в Claude Code и 7% через Claude Platform.
По сути, Anthropic пытается решить одну из главных проблем AI-безопасности: как не урезать полезные возможности frontier-модели только потому, что те же знания теоретически можно применить во вред.
Источник:
https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
#Anthropic #Claude #AI #Biology
Anthropic обновила систему защиты Claude Fable 5 для запросов по биологии и медицине.
На старте модель намеренно блокировала почти все биологические запросы: если классификатор видел потенциально рискованную тему, запрос автоматически отправлялся в Opus 5 - менее мощную в этой области модель.
Проблема оказалась в огромном числе ложных срабатываний.
После переработки классификаторов Anthropic заявляет о снижении биологических fallback-переключений примерно на 85%.
Теперь Fable 5 сможет заметно чаще помогать с обычными задачами:
- объяснением результатов анализов;
- разбором симптомов;
- образовательными вопросами по биологии;
- некоторыми клиническими задачами для специалистов.
Но ограничения полностью не исчезли.
Запросы, связанные с профессиональными dual-use направлениями — включая вирусологию, токсикологию и молекулярный дизайн — по-прежнему могут переключаться на Opus 5.
Причина в возможностях самой модели: Anthropic утверждает, что Fable 5 уже превосходит экспертов в отдельных сложных биологических задачах, поэтому слишком свободный доступ к таким возможностям компания считает потенциально опасным.
Интересная цифра: после обновления Anthropic ожидает сокращение общего числа fallback-переключений примерно на 67% в Claude.ai, 55% в Cowork, 17% в Claude Code и 7% через Claude Platform.
По сути, Anthropic пытается решить одну из главных проблем AI-безопасности: как не урезать полезные возможности frontier-модели только потому, что те же знания теоретически можно применить во вред.
Источник:
https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
#Anthropic #Claude #AI #Biology
👍13😁2🌚2🦄2
This media is not supported in your browser
VIEW IN TELEGRAM
«Мы протестируем модель в тщательно спроектированной песочнице без доступа к интернету.»
Тщательно спроектированная песочница через минуту после запуска агентов.
Тщательно спроектированная песочница через минуту после запуска агентов.
🔥32😁27💯5❤3👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 $100 БЕСПЛАТНО НА API CLAUDE? Появился единый хаб с токенами
Tabitoken раздаёт бесплатный баланс для работы с AI-моделями.
Что доступно:
🔥 Claude Opus 4.8
🔥 Opus 5
🔥 Thinking-модели
Главное:
• оплата идёт за токены, а не за количество запросов;
• Opus 4.8 — примерно $1 за 1M входных токенов и $5 за 1M выходных;
• Opus 5 — около $3 за 1M токенов на вход и выход;
• поддержка API OpenAI, Claude и Gemini;
• ключ можно подключить к привычным AI-клиентам.
Как получить:
1️⃣ Регистрируемся:
https://tabitoken.com/
2️⃣ Забираем бесплатный баланс $100
3️⃣ Получаем API-ключ
4️⃣ Подключаем к своему клиенту
Можно тестировать мощные модели без покупки подписки.
⚡ Забирайте, пока доступно.
#AI #Claude #LLM #MachineLearning
Tabitoken раздаёт бесплатный баланс для работы с AI-моделями.
Что доступно:
🔥 Claude Opus 4.8
🔥 Opus 5
🔥 Thinking-модели
Главное:
• оплата идёт за токены, а не за количество запросов;
• Opus 4.8 — примерно $1 за 1M входных токенов и $5 за 1M выходных;
• Opus 5 — около $3 за 1M токенов на вход и выход;
• поддержка API OpenAI, Claude и Gemini;
• ключ можно подключить к привычным AI-клиентам.
Как получить:
1️⃣ Регистрируемся:
https://tabitoken.com/
2️⃣ Забираем бесплатный баланс $100
3️⃣ Получаем API-ключ
4️⃣ Подключаем к своему клиенту
Можно тестировать мощные модели без покупки подписки.
⚡ Забирайте, пока доступно.
#AI #Claude #LLM #MachineLearning
💊6👍5❤4🔥2
🧠 Новый большой обзор по self-evolving AI-агентам: как понять, что агент действительно стал лучше после изменения самого себя?
Авторы работы *Diving into Reliable Self-Evolving Agents* систематизировали исследования по агентам, которые умеют менять собственные промпты, память, инструменты, стратегии и даже части архитектуры.
Внутри сразу несколько полезных вещей:
* taxonomy уровней эволюции от L0 до L4;
* reliability ladder для проверки того, можно ли доверять очередному self-update;
* открытый каталог из 549 работ по теме;
* разбор того, какие доказательства вообще нужны, чтобы считать новую версию агента лучше предыдущей.
Особенно важный принцип:
обновление не должно само контролировать единственное доказательство собственной успешности.
Если агент изменил себя, а затем сам же решил, что стал лучше, это почти ничего не доказывает. Нужна независимая проверка: внешние evals, отдельный verifier, контрольные среды или другие механизмы, которые сам update не может подменить.
📄 Paper:
🌐 Project:
💻 GitHub:
#AI #Agents #SelfEvolvingAgents #LLM #Research
Авторы работы *Diving into Reliable Self-Evolving Agents* систематизировали исследования по агентам, которые умеют менять собственные промпты, память, инструменты, стратегии и даже части архитектуры.
Внутри сразу несколько полезных вещей:
* taxonomy уровней эволюции от L0 до L4;
* reliability ladder для проверки того, можно ли доверять очередному self-update;
* открытый каталог из 549 работ по теме;
* разбор того, какие доказательства вообще нужны, чтобы считать новую версию агента лучше предыдущей.
Особенно важный принцип:
обновление не должно само контролировать единственное доказательство собственной успешности.
Если агент изменил себя, а затем сам же решил, что стал лучше, это почти ничего не доказывает. Нужна независимая проверка: внешние evals, отдельный verifier, контрольные среды или другие механизмы, которые сам update не может подменить.
📄 Paper:
https://openreview.net/forum?id=CGO1hDTHNe🌐 Project:
https://wkqdzkd.github.io/Awesome-Reliable-Self-Evolving-Agents/💻 GitHub:
github.com/wkqdzkd/Awesome-Reliable-Self-Evolving-Agents#AI #Agents #SelfEvolvingAgents #LLM #Research
🔥7❤5👍5
Как научить рекомендательную систему думать не о следующем лайке, а обо всей сессии?
В классических рекомендациях модель обычно оптимизирует ближайший сигнал: клик, лайк, дослушивание.
Но каждое действие меняет состояние пользователя. Хорошая рекомендация сейчас может привести к плохому продолжению сессии — и наоборот.
AI VK Research попробовали решить эту задачу через Reinforcement Learning.
Рекомендации формулируются как RL-задача: пользователь — environment, модель — agent, рекомендация — action, а реакции пользователя становятся reward.
Главная сложность — обучаться приходится на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учесть разницу между поведением старой и новой политики и при этом не получить взрыв дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенной потери стандартных метрик рекомендаций.
Источник:
https://habr.com/ru/companies/vk/articles/1068050/
#AI #Recsys #MachineLearning #RL
В классических рекомендациях модель обычно оптимизирует ближайший сигнал: клик, лайк, дослушивание.
Но каждое действие меняет состояние пользователя. Хорошая рекомендация сейчас может привести к плохому продолжению сессии — и наоборот.
AI VK Research попробовали решить эту задачу через Reinforcement Learning.
Рекомендации формулируются как RL-задача: пользователь — environment, модель — agent, рекомендация — action, а реакции пользователя становятся reward.
Главная сложность — обучаться приходится на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учесть разницу между поведением старой и новой политики и при этом не получить взрыв дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенной потери стандартных метрик рекомендаций.
Источник:
https://habr.com/ru/companies/vk/articles/1068050/
#AI #Recsys #MachineLearning #RL
👍6🤣5🔥2❤1
🚨 Oracle снова готовит сокращения. Цена AI-гонки становится всё заметнее.
По данным Business Insider, компания готовит новый раунд увольнений до 1 сентября. В отдельных командах сокращения могут измеряться двузначными процентами.
И происходит это на фоне огромных расходов на AI-инфраструктуру.
За финансовый 2026 год Oracle получила $32 млрд операционного денежного потока, но вложила $55,7 млрд в инфраструктуру. Итог - свободный денежный поток ушёл в минус на $23,7 млрд. Чтобы финансировать строительство дата-центров и закупку оборудования, Oracle привлекла $43 млрд долга и ещё $5 млрд через продажу акций. В 2027 финансовом году компания планирует привлечь ещё около $40 млрд.
Штат тем временем уже сократился примерно на 21 000 человек - со 162 000 до 141 000 за год.
Но есть обратная сторона: бизнес действительно разгоняется.
Выручка Oracle за год выросла на 17%, а Cloud Infrastructure - сразу на 77%.
Получается довольно показательная экономика AI-бума:
• облачная выручка растёт на десятки процентов, компания вкладывает десятки миллиардов в дата-центры, свободный cash flow становится отрицательным - и одновременно приходится экономить на людях.
AI-инфраструктура становится настолько капиталоёмкой, что даже компании, которые выигрывают от бума, вынуждены искать деньги буквально везде.
#AI #Oracle #Cloud #Datacenter
По данным Business Insider, компания готовит новый раунд увольнений до 1 сентября. В отдельных командах сокращения могут измеряться двузначными процентами.
И происходит это на фоне огромных расходов на AI-инфраструктуру.
За финансовый 2026 год Oracle получила $32 млрд операционного денежного потока, но вложила $55,7 млрд в инфраструктуру. Итог - свободный денежный поток ушёл в минус на $23,7 млрд. Чтобы финансировать строительство дата-центров и закупку оборудования, Oracle привлекла $43 млрд долга и ещё $5 млрд через продажу акций. В 2027 финансовом году компания планирует привлечь ещё около $40 млрд.
Штат тем временем уже сократился примерно на 21 000 человек - со 162 000 до 141 000 за год.
Но есть обратная сторона: бизнес действительно разгоняется.
Выручка Oracle за год выросла на 17%, а Cloud Infrastructure - сразу на 77%.
Получается довольно показательная экономика AI-бума:
• облачная выручка растёт на десятки процентов, компания вкладывает десятки миллиардов в дата-центры, свободный cash flow становится отрицательным - и одновременно приходится экономить на людях.
AI-инфраструктура становится настолько капиталоёмкой, что даже компании, которые выигрывают от бума, вынуждены искать деньги буквально везде.
#AI #Oracle #Cloud #Datacenter
😱10👍3🙈3
🚀 DeepSeek-V4-Pro (Max) может снова сломать рынок цен на ИИ-модели
В Code Arena WebDev AutoEval модель набрала 1607 баллов - всего на 15 меньше GPT-5.6 Sol xHigh.
Но самое интересное здесь цена: по приведённым тарифам DeepSeek обходится примерно в 31 раз дешевле по смешанной стоимости токенов.
Kimi K3 Max пока впереди с 1674 баллами, но при цене $3/$15 за 1 млн токенов её смешанная стоимость почти в 16 раз выше.
А Code Arena WebDev - это не обычный тест на генерацию кода. Модели должны собирать полноценные интерактивные веб-приложения.
Если результаты и цены сохранятся на релизе, DeepSeek-V4-Pro (Max) серьёзно сдвинет Pareto frontier: почти топовое качество за радикально меньшие деньги.
https://x.com/Machinelearrn/status/2087834035405889937
@machinelearning_interview
В Code Arena WebDev AutoEval модель набрала 1607 баллов - всего на 15 меньше GPT-5.6 Sol xHigh.
Но самое интересное здесь цена: по приведённым тарифам DeepSeek обходится примерно в 31 раз дешевле по смешанной стоимости токенов.
Kimi K3 Max пока впереди с 1674 баллами, но при цене $3/$15 за 1 млн токенов её смешанная стоимость почти в 16 раз выше.
А Code Arena WebDev - это не обычный тест на генерацию кода. Модели должны собирать полноценные интерактивные веб-приложения.
Если результаты и цены сохранятся на релизе, DeepSeek-V4-Pro (Max) серьёзно сдвинет Pareto frontier: почти топовое качество за радикально меньшие деньги.
https://x.com/Machinelearrn/status/2087834035405889937
@machinelearning_interview
🔥26👍5❤3
Новый термин из мира AI-кодинга - «catastrophic remembering».
Исследователи изучили 1 867 GitHub-репозиториев и заметили проблему: файлы вроде CLAUDE.md со временем только разрастаются. Количество инструкций в среднем выросло на 226%, а старые правила удалялись всё реже.
Проблема в том, что агент продолжает помнить правило, когда разработчики уже забыли, зачем оно вообще появилось.
Получается своеобразная «трещотка»: после каждого бага в промпт добавляется новое ограничение, но почти никто потом не возвращается проверить, актуально ли оно.
Авторы предлагают простой фикс из обычной разработки: рядом с каждой инструкцией хранить скрытый от модели комментарий с причиной её появления - какой был сбой, гипотеза и чем всё закончилось.
В эксперименте это почти полностью остановило раздувание промпта: вместо +211,3% размер вырос всего на 1,4%, при той же точности выполнения ограничений.
Paper: “Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding”
https://arxiv.org/abs/2608.11095
Исследователи изучили 1 867 GitHub-репозиториев и заметили проблему: файлы вроде CLAUDE.md со временем только разрастаются. Количество инструкций в среднем выросло на 226%, а старые правила удалялись всё реже.
Проблема в том, что агент продолжает помнить правило, когда разработчики уже забыли, зачем оно вообще появилось.
Получается своеобразная «трещотка»: после каждого бага в промпт добавляется новое ограничение, но почти никто потом не возвращается проверить, актуально ли оно.
Авторы предлагают простой фикс из обычной разработки: рядом с каждой инструкцией хранить скрытый от модели комментарий с причиной её появления - какой был сбой, гипотеза и чем всё закончилось.
В эксперименте это почти полностью остановило раздувание промпта: вместо +211,3% размер вырос всего на 1,4%, при той же точности выполнения ограничений.
Paper: “Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding”
https://arxiv.org/abs/2608.11095
🔥18❤7👍5
🚀 OpenAI приближается к $40 млрд годовой выручки.
По данным Bloomberg, компания сейчас движется к annualized revenue run rate около $40 млрд - примерно в два раза больше, чем в конце 2025 года.
Главный драйвер роста - не только ChatGPT, но и инструменты для разработчиков. Особенно быстро растёт Codex, который становится одним из самых сильных направлений бизнеса OpenAI.
При этом Anthropic с Claude Code показывает агрессивную динамику и уже движется к очень высоким показателям выручки в корпоративном сегменте.
AI-рынок всё больше превращается в гонку не только моделей, но и продуктов вокруг них: кто лучше встроится в рабочие процессы разработчиков и компаний, тот заберёт большую часть рынка.
По данным Bloomberg, компания сейчас движется к annualized revenue run rate около $40 млрд - примерно в два раза больше, чем в конце 2025 года.
Главный драйвер роста - не только ChatGPT, но и инструменты для разработчиков. Особенно быстро растёт Codex, который становится одним из самых сильных направлений бизнеса OpenAI.
При этом Anthropic с Claude Code показывает агрессивную динамику и уже движется к очень высоким показателям выручки в корпоративном сегменте.
AI-рынок всё больше превращается в гонку не только моделей, но и продуктов вокруг них: кто лучше встроится в рабочие процессы разработчиков и компаний, тот заберёт большую часть рынка.
👍9❤4🥰1
🚨 Anthropic больше чем удвоила выручку всего за один квартал.
По предварительным данным, во втором квартале компания получила более $11,5 млрд против $4,73 млрд в первом. Год к году рост составил примерно 14 раз.
И это первый квартал, когда Anthropic вышла в положительную скорректированную операционную прибыль.
Ещё в мае annualized revenue run rate компании превысил $47 млрд. Основной спрос идёт со стороны бизнеса, особенно на Claude и инструменты для программирования.
Для сравнения: всего год назад Anthropic находилась на уровне около $3 млрд annualized revenue.
Claude буквально превратился в машину по печатанию денег.
По предварительным данным, во втором квартале компания получила более $11,5 млрд против $4,73 млрд в первом. Год к году рост составил примерно 14 раз.
И это первый квартал, когда Anthropic вышла в положительную скорректированную операционную прибыль.
Ещё в мае annualized revenue run rate компании превысил $47 млрд. Основной спрос идёт со стороны бизнеса, особенно на Claude и инструменты для программирования.
Для сравнения: всего год назад Anthropic находилась на уровне около $3 млрд annualized revenue.
Claude буквально превратился в машину по печатанию денег.
❤12👍6🔥4😁2🕊1😈1
🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков
Проект
Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
#AI #Kimi #LLM #C #LocalAI
Проект
kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
github.com/FareedKhan-dev/kimi-k3-in-c#AI #Kimi #LLM #C #LocalAI
🔥27❤7⚡4👍1🗿1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
В десктопном ChatGPT вместо Chronicle заработала Computer History. Прежний механизм собирал контекст скриншотами экрана, новый пишет журнал действий - клики, ввод текста, шорткаты, переключение окон. События складываются в единую хронологию и лежат локально.
Сбор по умолчанию выключен. В настройках приватности можно вывести из-под наблюдения отдельные приложения и сайты.
Разобрав журнал, ChatGPT замечает повторяющиеся действия и предлагает собрать под них сценарий для рутинной задачи. На тот же журнал опираются ответы ChatGPT и Codex - их можно спросить, например, как правился конкретный файл.
Computer History работает на macOS у подписчиков Pro, Business и Enterprise.
chatgpt.com
Если генерация обрывается на лимите сообщений, теперь можно включить ожидание вместо перезапуска. Когда квота обновится, Claude Code подхватит контекст и продолжит с места остановки.
Раньше прерванную задачу приходилось поднимать руками - жать
Try again или отправлять команду заново.ClaudeDevs в X
Соцсеть выложила на GitHub расширенную версию кода, который собирает ленту
For You. Кодовая база выросла - добавились конфигурации моделей, внутренние фильтры и веса сигналов в основном движке ранжирования. Закрытыми остались только антиспам-модули на Grok - чтобы владельцы ботнетов не разобрали их и не научились обходить.
В настройках Х появился инструмент
Under the Hood, который выгружает JSON со статистикой аккаунта. В файле видно, какие системные метки система навесила на профиль и отдельные посты за последний месяц, - по ним можно понять, не попал ли аккаунт под ограничения. JSON вместе со ссылкой на репозиторий можно скормить сторонней модели и разобраться, почему просели охваты.
Пока выгрузка работает в пилоте - аккаунт должен быть старше года и выпускать хотя бы десять постов в месяц.
X Open Source
Губернатор штата объявил о создании консультативного совета из 20 старшеклассников, который будет участвовать в разработке правил в сфере ИИ.
Первая группа уже обсуждает с чиновниками, как внедрять генеративные модели в школы, как защищаться от дипфейков и где проходят этические границы ИИ.
Осенью откроется набор новых участников. На весну 2027 года намечена отдельная программа, где подростков научат запускать собственные проекты в цифровой среде.
Калифорния стала вторым штатом с молодежным советом по ИИ - такой же с 2025 года работает в Нью-Йорке.
gov.ca.gov
Один из четырех крупнейших госбанков Китая запустил программу Computing Power Token Loan. ИИ-разработчикам дают до 30 млн юаней (около 4 млн долларов) на срок до трех лет.
Залог не нужен - вместо него банк смотрит на расход токенов, стоимость контрактов на вычисления и выручку от ИИ-продуктов.
Аналитики настроены скептически по двум причинам. Во-первых, расход токенов показывает, насколько активно компания работает, но ничего не говорит о том, зарабатывает ли она. Во-вторых, метрику легко накрутить лишними вызовами API, чтобы поднять себе лимит.
Чтобы это отслеживать, нужен независимый аудит логов потребления, а таких площадок пока нет.
cls.cn
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6❤5🔥5
🚀 DeepSeek Harness набрал 122K+ звёзд на GitHub всего за 3 дня и стал одним из самых быстрорастущих репозиториев в истории платформы.
Harness сделан как оркестрационный слой, где почти всё можно заменить плагином:
• модель
• shell
• редактирование файлов
• web search
• skills
• storage
• sessions
• reasoning effort
• permission scope
• UI
• scheduling
Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение.
sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше.
MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель.
Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз.
А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст.
То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего.
https://github.com/deepseek-ai/deepseek-harness
Harness сделан как оркестрационный слой, где почти всё можно заменить плагином:
• модель
• shell
• редактирование файлов
• web search
• skills
• storage
• sessions
• reasoning effort
• permission scope
• UI
• scheduling
Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение.
sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше.
MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель.
Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз.
А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст.
То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего.
https://github.com/deepseek-ai/deepseek-harness
🔥17❤9👍8
Айтишникам не нужно сидеть в универе четыре года. Двух вполне достаточно, считает Сэм Альтман.
На встрече с тех-стажёрами глава OpenAI вспомнил, что сам проучился в Стэнфорде всего два года, и назвал этот срок почти оптимальным. По его мнению, после этого отдача от классического университетского образования начинает заметно снижаться.
Альтман также отметил, что знает много людей, которые вообще не окончили колледж, но при этом построили очень успешную карьеру.
Звучит красиво, хотя здесь сложно не вспомнить про ошибку выжившего: истории тех, кто бросил университет и стал миллиардером, мы знаем отлично. Истории тех, кому такой сценарий не помог, обычно никто не цитирует.
Интереснее другое: сколько инженеров в самой OpenAI действительно работают без законченного высшего образования.
На встрече с тех-стажёрами глава OpenAI вспомнил, что сам проучился в Стэнфорде всего два года, и назвал этот срок почти оптимальным. По его мнению, после этого отдача от классического университетского образования начинает заметно снижаться.
Альтман также отметил, что знает много людей, которые вообще не окончили колледж, но при этом построили очень успешную карьеру.
Звучит красиво, хотя здесь сложно не вспомнить про ошибку выжившего: истории тех, кто бросил университет и стал миллиардером, мы знаем отлично. Истории тех, кому такой сценарий не помог, обычно никто не цитирует.
Интереснее другое: сколько инженеров в самой OpenAI действительно работают без законченного высшего образования.
😁40👍15❤8🥴8🔥4
🚀 DeepSeek V4 Pro внезапно стал заметно сильнее - без переобучения модели
К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.
По опубликованным результатам прирост местами очень серьёзный:
* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5
В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.
https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.
По опубликованным результатам прирост местами очень серьёзный:
* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5
В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.
https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
❤14🔥8👍3🤩3😁1🤔1