Вай, что за праздник, и Fable 5 дают еще гонять!
Ох уж эти ритуалы IPO и конкуренция в США среди AI вендоров )))
#Anthropic #Claude
Ох уж эти ритуалы IPO и конкуренция в США среди AI вендоров )))
#Anthropic #Claude
Когда в 2025 году наш рынок ИТ стал рынком работодателя, то работодатели радостно потирая ручки снизили оклады на входе.
В 2026 году они нарвались на ответочку: независимо от уровня и послужной специалиста в ИТ, все тестовые задания за такое отношение работодателей к ним они сдают в виде нейрослопа.
И теперь работодатели в растерянности.
В 2026 году они нарвались на ответочку: независимо от уровня и послужной специалиста в ИТ, все тестовые задания за такое отношение работодателей к ним они сдают в виде нейрослопа.
И теперь работодатели в растерянности.
Гейчат: "Простите, мы перегрелись"
https://status.openai.com/ - сбоит 31 компонент
https://status.openai.com/ - сбоит 31 компонент
Forwarded from сбежавшая нейросеть
Opus 5 – новый флагман Anthropic
Вышел Opus 5, в большинстве бенчмарков он обходит Fable 5, но удивительного здесь нет. По слухам, первые версии Claude Mythos (на ней строится коммерческая Fable 5) были доступны сотрудникам Anthropic в феврале, закрытый Project Glasswing стартовал в апреле, а Fable 5 попробовали выпустить в начале июня – но из-за вмешательства властей США отложили.
Пять месяцев – более чем достаточно, чтобы из архитектуры топовой модели собрать “массовый флагман”, каким и является Opus 5.
Из бенчмарков бросается в глаза ARC-AGI-3 с результатом 30,2% против 7,8% у прошлого лидера – GPT-5.6 Sol. Это бенчмарк на абстрактное мышление: в нем модель оказывается внутри пошаговой игры, вообще без объяснений, как ее проходить. Методом проб и ошибок ИИ должен понять правила игры, а затем выиграть. Игр в бенчмарке много, каждая – со своими особенностями.
Бенчмарк сложный, но вот что интересно. ARC-AGI-3 представили 25 марта – явно раньше, чем началось обучение Opus 5. И это позволяет сказать, что в Anthropic, изучив доступные задачи бенчмарка (их минимум, большинство держат в секрете), попробовали натаскать новую модель на него.
Официально про это нигде не говорится, но это было бы логично, более того, это, возможно, уже дало положительный эффект: для прохождения ARC-AGI-3 нужна “сообразительность” и ее Opus 5 проявляет и в других сферах.
Блогпост Anthropic описывает ситуацию, как Opus 5 дали файл с чертежом механической детали с задачей написать программу, которая соберет эту деталь во FreeCAD. При отключили модели компьютерное зрение – то есть файл с чертежом был, но посмотреть его не получалось.
Другие ИИ в такой ситуации останавливались и сообщали, что не могут выполнить задачу. Opus 5 открыл файл как то, чем картинка является на самом деле, – длинную таблицу чисел, по три штуки на каждую точку экрана. И написал с нуля собственную программу, которая по этим числам находит прямые линии, окружности, размерные стрелки. То есть смастерил простенькое “компьютерное зрение” сам.
Если говорить про другие бенчмарки, то отрыв от Fable 5 реальный в трех местах, зато важных: агентское программирование (43,3 против 33,7), бизнес-задачи (26,0 против 17,4) и работа за компьютером (70,6 против 66,1). Это задачи, где модель пашет долго и без присмотра.
Остальное — размен: на HLE 56,3 против 56,5, на двух кодовых бенчмарках отставание в десятые доли. Проигрывает заметно только в юриспруденции и медицине. Это именно тот уровень прогресса, который я и ожидал от Opus 5 за такое время.
При этом модель в два раза дешевле Fable 5, доступна на базовой подписке Pro, а на подписках Max на нее можно тратить весь лимит, а не 50%. Если не будет какого-то косяка в виде кривого стиля или высокого уровня галлюцинаций – Fable 5 можно отправлять на пенсию до выхода 5.1.
Еще интересный факт. Mythos/Fable 5 в свое время перепугал и разработчиков, и даже власти США из-за крутых возможностей по поиску уязвимостей. Opus 5 намеренно не стали обучать кибербезопасности – но в бенчмарке на поиск уязвимостей она все равно набрала 79,4% против 80% у Mythos. Я как-то писал об этом: если учить модель хорошо писать код – она автоматом учится искать уязвимости.
В Anthropic предупредили, что у Opus 5, как и у Fable 5, будет fallback-механизм, переключающий на Opus 4.8 запросы, которые покажутся опасными. Но настроен он, судя по всему, намного лучше: если Fable 5 у меня отказывалась отвечать на такие безобидные промпты, как “дай свое объяснение парадоксу Ферми” или “объясни, как устроен мозг осьминога”, то Opus 5 сейчас на все ответил.
Параллельно прогнал модель еще на нескольких запросах – понравилось, как Opus 5 делает веб-дизайн, ищет в сети и генерит идеи. Стиль письма своеобразный, это еще надо тестить.
–
Друзья, традиционно по пятницам я выпускаю новый лонгрид в подписке. Он уже на месте, но подробно представлю завтра. Но если кому не терпится, это лонгрид по мотивам рекомендаций Бориса Черни о том, как пятью этапами стать профессионалом в ИИ.
Читаем здесь:
— Бусти
— Sponsr
Вышел Opus 5, в большинстве бенчмарков он обходит Fable 5, но удивительного здесь нет. По слухам, первые версии Claude Mythos (на ней строится коммерческая Fable 5) были доступны сотрудникам Anthropic в феврале, закрытый Project Glasswing стартовал в апреле, а Fable 5 попробовали выпустить в начале июня – но из-за вмешательства властей США отложили.
Пять месяцев – более чем достаточно, чтобы из архитектуры топовой модели собрать “массовый флагман”, каким и является Opus 5.
Из бенчмарков бросается в глаза ARC-AGI-3 с результатом 30,2% против 7,8% у прошлого лидера – GPT-5.6 Sol. Это бенчмарк на абстрактное мышление: в нем модель оказывается внутри пошаговой игры, вообще без объяснений, как ее проходить. Методом проб и ошибок ИИ должен понять правила игры, а затем выиграть. Игр в бенчмарке много, каждая – со своими особенностями.
Бенчмарк сложный, но вот что интересно. ARC-AGI-3 представили 25 марта – явно раньше, чем началось обучение Opus 5. И это позволяет сказать, что в Anthropic, изучив доступные задачи бенчмарка (их минимум, большинство держат в секрете), попробовали натаскать новую модель на него.
Официально про это нигде не говорится, но это было бы логично, более того, это, возможно, уже дало положительный эффект: для прохождения ARC-AGI-3 нужна “сообразительность” и ее Opus 5 проявляет и в других сферах.
Блогпост Anthropic описывает ситуацию, как Opus 5 дали файл с чертежом механической детали с задачей написать программу, которая соберет эту деталь во FreeCAD. При отключили модели компьютерное зрение – то есть файл с чертежом был, но посмотреть его не получалось.
Другие ИИ в такой ситуации останавливались и сообщали, что не могут выполнить задачу. Opus 5 открыл файл как то, чем картинка является на самом деле, – длинную таблицу чисел, по три штуки на каждую точку экрана. И написал с нуля собственную программу, которая по этим числам находит прямые линии, окружности, размерные стрелки. То есть смастерил простенькое “компьютерное зрение” сам.
Если говорить про другие бенчмарки, то отрыв от Fable 5 реальный в трех местах, зато важных: агентское программирование (43,3 против 33,7), бизнес-задачи (26,0 против 17,4) и работа за компьютером (70,6 против 66,1). Это задачи, где модель пашет долго и без присмотра.
Остальное — размен: на HLE 56,3 против 56,5, на двух кодовых бенчмарках отставание в десятые доли. Проигрывает заметно только в юриспруденции и медицине. Это именно тот уровень прогресса, который я и ожидал от Opus 5 за такое время.
При этом модель в два раза дешевле Fable 5, доступна на базовой подписке Pro, а на подписках Max на нее можно тратить весь лимит, а не 50%. Если не будет какого-то косяка в виде кривого стиля или высокого уровня галлюцинаций – Fable 5 можно отправлять на пенсию до выхода 5.1.
Еще интересный факт. Mythos/Fable 5 в свое время перепугал и разработчиков, и даже власти США из-за крутых возможностей по поиску уязвимостей. Opus 5 намеренно не стали обучать кибербезопасности – но в бенчмарке на поиск уязвимостей она все равно набрала 79,4% против 80% у Mythos. Я как-то писал об этом: если учить модель хорошо писать код – она автоматом учится искать уязвимости.
В Anthropic предупредили, что у Opus 5, как и у Fable 5, будет fallback-механизм, переключающий на Opus 4.8 запросы, которые покажутся опасными. Но настроен он, судя по всему, намного лучше: если Fable 5 у меня отказывалась отвечать на такие безобидные промпты, как “дай свое объяснение парадоксу Ферми” или “объясни, как устроен мозг осьминога”, то Opus 5 сейчас на все ответил.
Параллельно прогнал модель еще на нескольких запросах – понравилось, как Opus 5 делает веб-дизайн, ищет в сети и генерит идеи. Стиль письма своеобразный, это еще надо тестить.
–
Друзья, традиционно по пятницам я выпускаю новый лонгрид в подписке. Он уже на месте, но подробно представлю завтра. Но если кому не терпится, это лонгрид по мотивам рекомендаций Бориса Черни о том, как пятью этапами стать профессионалом в ИИ.
Читаем здесь:
— Бусти
— Sponsr
Forwarded from headlines
Forwarded from opennet.ru
В ночных сборках доступен для тестирования новый интерфейс Firefox
В ночных сборках Firefox доступен для тестирования новый интерфейс пользователя, выполненной в рамках проекта Nova. Основные изменения.
Подробнее:
https://opennet.ru/65992/
https://opennet.iss.one/65992/
В ночных сборках Firefox доступен для тестирования новый интерфейс пользователя, выполненной в рамках проекта Nova. Основные изменения.
Подробнее:
https://opennet.ru/65992/
https://opennet.iss.one/65992/
Forwarded from ML&|Sec Feed
OWASP_LLMSVS_v2_0_RU_неофициальный_перевод.docx
69.1 KB
OWASP LLMSVS v2.0 - практический стандарт проверки безопасности систем на основе LLM, охватывающий жизненный цикл моделей, данные и память, RAG, интеграции, AI-агентов, инструменты, зависимости и мониторинг. Его главная польза - набор из 70 требований КБ трех уровней строгости.
https://owasp.org/www-project-llm-verification-standard/LLMSVS-v2.0-en.html
https://owasp.org/www-project-llm-verification-standard/LLMSVS-v2.0-en.html
Forwarded from Борис_ь с ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Google выложила в открытый доступ набор скилов для поиска, воспроизведения и устранения уязвимостей - Mantis. Проект развивается и сами авторы пишут, что это больше стартовая точка для дальнейшего развития пользователями, нежели чем готовы к применению продукт.
GitHub
GitHub - google/mantis: A modular, stack-agnostic toolkit of security review skills for AI coding agents to autonomously find,…
A modular, stack-agnostic toolkit of security review skills for AI coding agents to autonomously find, reproduce, and patch vulnerabilities. - google/mantis
Forwarded from РИА Новости
Одна из крупнейших мировых аудиторских компаний PwC опубликовала отчеты с ошибками, сгенерированными ИИ.
Забавные детали приводит Financial Times:
🔹В одном случае ИИ, похоже, полностью выдумал научную статью о качестве воздуха в Эр-Рияде.
🔹Одним из источников для описания проекта, связанного с банком JPMorgan, оказался блог подростка, у которого 280 подписчиков.
🔹Еще один отчет ссылался на исследование самой PwC – а это некорректно.
🔹Ну а в тексте одной из гиперссылок была пометка chatgpt. сom.
В компании заявили, что серьезно относятся к точности своих исследований и уже обновляют ссылки.
🔹 Подписаться на РИА Новости
Забавные детали приводит Financial Times:
🔹В одном случае ИИ, похоже, полностью выдумал научную статью о качестве воздуха в Эр-Рияде.
🔹Одним из источников для описания проекта, связанного с банком JPMorgan, оказался блог подростка, у которого 280 подписчиков.
🔹Еще один отчет ссылался на исследование самой PwC – а это некорректно.
🔹Ну а в тексте одной из гиперссылок была пометка chatgpt. сom.
В компании заявили, что серьезно относятся к точности своих исследований и уже обновляют ссылки.
Please open Telegram to view this post
VIEW IN TELEGRAM
Павел Дуров внесен в перечень террористов и экстремистов — Росфинмониторинг.
Похоже, большинству россиян придется уйти из тг 😐
Похоже, большинству россиян придется уйти из тг 😐
Forwarded from SecAtor
Claroty провела анализ 750 000 киберфизических систем в крупнейших ЦОДах по всему миру и сообщает неутешительные новости.
Согласно новым исследованиям, почти каждая пятая киберфизическая система (КПС), обеспечивающая работу крупнейших в мире ЦОДов, находится всего в одном сетевом соединении от путей, которые могут позволить злоумышленникам получить к ней доступ.
Для этого Claroty проанализировала более 750 000 объектов ЦОД, включая примерно 191 000 объектов OT и 174 000 объектов инфраструктуры.
К объектам инфраструктуры ЦОД относятся системы отопления, вентиляции и кондиционирования воздуха (HVAC), системы мониторинга и распределения электроэнергии, системы противопожарной защиты и системы бесперебойного питания (UPS).
Анализ показал, что из 174 000 объектов инфраструктуры менее 1000 (0,4%) напрямую подключены к интернету. Однако примерно 32 000 (18%) находятся «в одном шаге» от систем, подключенных к интернету, что представляет собой потенциальный вектор доступа для злоумышленников.
Пути атаки могут привести злоумышленников к уязвимым местам в киберфизических системах, таким как небезопасные протоколы связи, известные уязвимости, которые эксплуатируются злоумышленниками (KEV), неуправляемые технологии удаленного доступа, плоские сетевые архитектуры, слабые механизмы аутентификации и неправильно настроенные каналы связи с активами.
В заявлении также утверждается, что получение доступа к операционной инфраструктуре, контролирующей критически важные функции центров обработки данных, влечет за собой серьезные последствия.
Успешные атаки на киберфизические системы внутри центров обработки данных могут нарушить работу систем охлаждения, повлиять на распределение электроэнергии, поставить под угрозу системы контроля микроклимата, помешать работе резервных систем генерации и снизить общую отказоустойчивость.
Claroty обнаружила, что 41% блоков распределения электроэнергии и 32% систем отопления, вентиляции и кондиционирования воздуха находятся всего в одном шаге от опасного подключения к интернету.
Компания выявила и другие типы угроз безопасности, в том числе связанные с системами управления зданиями, которые в 88% случаев обмениваются данными по небезопасным протоколам, а в 40% случаев используют устаревшее ПО.
Исследователи Claroty также задетектили тысячи устройств, затронутых уязвимостями, которые, как известно, были использованы злоумышленниками в реальных условиях.
В случае систем управления OT, включая устройства SCADA и PLC, 11 000 устройств имели известные уязвимости, которые были использованы злоумышленниками.
В отчете Claroty также изложены практические шаги по повышению операционной устойчивости ЦОДов, а операторам настоятельно рекомендуется внедрять непрерывное управление рисками, сегментацию сети по принципу «нулевого доверия», усиление защиты систем управления зданиями и обнаружение угроз с учетом протоколов.
Согласно новым исследованиям, почти каждая пятая киберфизическая система (КПС), обеспечивающая работу крупнейших в мире ЦОДов, находится всего в одном сетевом соединении от путей, которые могут позволить злоумышленникам получить к ней доступ.
Для этого Claroty проанализировала более 750 000 объектов ЦОД, включая примерно 191 000 объектов OT и 174 000 объектов инфраструктуры.
К объектам инфраструктуры ЦОД относятся системы отопления, вентиляции и кондиционирования воздуха (HVAC), системы мониторинга и распределения электроэнергии, системы противопожарной защиты и системы бесперебойного питания (UPS).
Анализ показал, что из 174 000 объектов инфраструктуры менее 1000 (0,4%) напрямую подключены к интернету. Однако примерно 32 000 (18%) находятся «в одном шаге» от систем, подключенных к интернету, что представляет собой потенциальный вектор доступа для злоумышленников.
Пути атаки могут привести злоумышленников к уязвимым местам в киберфизических системах, таким как небезопасные протоколы связи, известные уязвимости, которые эксплуатируются злоумышленниками (KEV), неуправляемые технологии удаленного доступа, плоские сетевые архитектуры, слабые механизмы аутентификации и неправильно настроенные каналы связи с активами.
В заявлении также утверждается, что получение доступа к операционной инфраструктуре, контролирующей критически важные функции центров обработки данных, влечет за собой серьезные последствия.
Успешные атаки на киберфизические системы внутри центров обработки данных могут нарушить работу систем охлаждения, повлиять на распределение электроэнергии, поставить под угрозу системы контроля микроклимата, помешать работе резервных систем генерации и снизить общую отказоустойчивость.
Claroty обнаружила, что 41% блоков распределения электроэнергии и 32% систем отопления, вентиляции и кондиционирования воздуха находятся всего в одном шаге от опасного подключения к интернету.
Компания выявила и другие типы угроз безопасности, в том числе связанные с системами управления зданиями, которые в 88% случаев обмениваются данными по небезопасным протоколам, а в 40% случаев используют устаревшее ПО.
Исследователи Claroty также задетектили тысячи устройств, затронутых уязвимостями, которые, как известно, были использованы злоумышленниками в реальных условиях.
В случае систем управления OT, включая устройства SCADA и PLC, 11 000 устройств имели известные уязвимости, которые были использованы злоумышленниками.
В отчете Claroty также изложены практические шаги по повышению операционной устойчивости ЦОДов, а операторам настоятельно рекомендуется внедрять непрерывное управление рисками, сегментацию сети по принципу «нулевого доверия», усиление защиты систем управления зданиями и обнаружение угроз с учетом протоколов.
Forwarded from запуск завтра
Тем временем Митчел Хашимото запустил новый стартап Superlogical: хочет сделать крутой современный мультплексер (tmux — пример мультиплексера, который держит Unix сессию, пока ты отключился от сервера и позволяет делить ее с друзьями).
Признает, что звучит мелко; но говорит, что если сделать это правильно, получится штука, которая поможет облегчить переход между средой разработки и продакшеном и обратно. Structured data, actions, history.
У меня этот набор слов ассоциируется со Smalltalk. А Митчел — один из немногих, у кого может получиться. 👀
Признает, что звучит мелко; но говорит, что если сделать это правильно, получится штука, которая поможет облегчить переход между средой разработки и продакшеном и обратно. Structured data, actions, history.
У меня этот набор слов ассоциируется со Smalltalk. А Митчел — один из немногих, у кого может получиться. 👀
Мало кто понимает из работодателей, что рост знаний с появлением ИИ в РФ практически остановлен - все, кого образование не научило учиться - теперь необучаемы и инвестиции в их развитие будут бесполезны.
Из технических и гуманитарных ВУЗов, которые оставляют человеку шанс на саморазвитие - МФТИ, и-т Мориса Тореза, Журфак МГУ, ВШ КГБ/АФСБ/ИКСИ.
Все остальные теперь - ездовые лошади, запечатанные наглухо в ловушке ИИ.
Из технических и гуманитарных ВУЗов, которые оставляют человеку шанс на саморазвитие - МФТИ, и-т Мориса Тореза, Журфак МГУ, ВШ КГБ/АФСБ/ИКСИ.
Все остальные теперь - ездовые лошади, запечатанные наглухо в ловушке ИИ.
Forwarded from opennet.ru
Из-за новой атаки в AUR отключена передача бесхозных пакетов новым сопровождающим
Проект Arch Linux объявил о приостановке передачи бесхозных пакетов новым сопровождающим в репозитории AUR (Arch User Repository). В качестве причины называется возобновление атак по подстановке вредоносного кода в пакеты, оставшиеся без сопровождения. Для захвата пакетов атакующие использовали предоставляемую в AUR возможность принимать сопровождение над пакетами, оставшимися без сопровождающих и имеющими статус orphaned.
Подробнее:
https://opennet.ru/66005/
https://opennet.iss.one/66005/
Проект Arch Linux объявил о приостановке передачи бесхозных пакетов новым сопровождающим в репозитории AUR (Arch User Repository). В качестве причины называется возобновление атак по подстановке вредоносного кода в пакеты, оставшиеся без сопровождения. Для захвата пакетов атакующие использовали предоставляемую в AUR возможность принимать сопровождение над пакетами, оставшимися без сопровождающих и имеющими статус orphaned.
Подробнее:
https://opennet.ru/66005/
https://opennet.iss.one/66005/
Forwarded from headlines
В четверг компания Microsoft Corp. вошла в историю рынка, прибавив к своей стоимости почти полтриллиона долларов — это самый большой суточный прирост стоимости любой акции.
bloomberg.com
bloomberg.com
Forwarded from ITeach: твоя кибербезопасность
Amazon «случайно» потратила почти 2 млн долларов на токены Claude — агент превысил выделенный бюджет на 860%.
Он 5 месяцев безостановочно выполнял одну задачу — сопоставлял авторов книг с актуальными объявлениями по продаже. С задачей агент так и не справился, а в конце пришёл счёт на $1,8 миллиона долларов.
Самое забавное, что Amazon прокомментировала ситуацию: «Мы экспериментируем».
Лица уволенных разработчиков представили?
ITeach
Он 5 месяцев безостановочно выполнял одну задачу — сопоставлял авторов книг с актуальными объявлениями по продаже. С задачей агент так и не справился, а в конце пришёл счёт на $1,8 миллиона долларов.
Самое забавное, что Amazon прокомментировала ситуацию: «Мы экспериментируем».
Лица уволенных разработчиков представили?
ITeach
Forwarded from alex0x08
Забыл же поздравить всех причастных:
Пусть BOFH станет для вас образцом для подражания😉
С днем сисадмина! Оу-еее🤟
Пусть BOFH станет для вас образцом для подражания😉