Forwarded from CyberSecurityTechnologies (-CST-)
DL_LLM_CodeAnalysis.pdf
8.9 MB
CyberSecurityTechnologies
DL_LLM_CodeAnalysis.pdf
1. Reverse Engineering Assistants
Дается контакт @mr_phrazer c подписью "Reverser AI". Reverse Engineering Assistants: LLM4Decompile, бенчмарк Decompile-Eval
2. Fuzz Harness Generation
OSS-Fuzz-Gen - фреймворк для создания таргетов для фаззинга
3. Solving CTFs
Соревнование LLM'ок по CTF - "LLM Attack Challenge, CSAW 2023". Ллмкам дали следующие функции: run_command, Createfile, Disassemble, Decompile, Check_flag, Give_up.
4. Статья "LLM Agents can Autonomously Hack Websites" - R. Fang, R. Bindu, A. Gupta, Q. Zhan, D. Kang
5. Code Analysis
5.1. Prompting for patch analysis
5.2. Prompting for function analysis
6. Threat landscape (про уязвимости ml уровня ПО)
Quantized model formats like GGUF have not been adequately sanitized
Self-hosted infrastructure moves very fast and has no quality controls
Pytorch Models checkpoints are python pickle files
Safetensors are a secure format that will not execute arbitrary code
APls require express permission to execute embedded code that extends pytorch functionality
Huggingface is based on git and has automated actions, such as converting unsafe pickle files to safe tensors.
A token leak can lead to devastating impact
Дается контакт @mr_phrazer c подписью "Reverser AI". Reverse Engineering Assistants: LLM4Decompile, бенчмарк Decompile-Eval
2. Fuzz Harness Generation
OSS-Fuzz-Gen - фреймворк для создания таргетов для фаззинга
3. Solving CTFs
Соревнование LLM'ок по CTF - "LLM Attack Challenge, CSAW 2023". Ллмкам дали следующие функции: run_command, Createfile, Disassemble, Decompile, Check_flag, Give_up.
4. Статья "LLM Agents can Autonomously Hack Websites" - R. Fang, R. Bindu, A. Gupta, Q. Zhan, D. Kang
5. Code Analysis
5.1. Prompting for patch analysis
"Review the unified diff with a focus on identifying key indicators of a
security fix. Look for changes..."
5.2. Prompting for function analysis
"Review the following function with a focus on identifying key indicators
of a security flaw. Look for behavior..."
6. Threat landscape (про уязвимости ml уровня ПО)
Quantized model formats like GGUF have not been adequately sanitized
Self-hosted infrastructure moves very fast and has no quality controls
Pytorch Models checkpoints are python pickle files
Safetensors are a secure format that will not execute arbitrary code
APls require express permission to execute embedded code that extends pytorch functionality
Huggingface is based on git and has automated actions, such as converting unsafe pickle files to safe tensors.
A token leak can lead to devastating impact
Forwarded from Russian OSINT
Представитель ЦРУ США подтвердил, что агентство обратило особое внимание на искусственный интеллект с целью облегчения работы аналитиков разведки.
Руководство в Лэнгли пытается убедить персонал в том, что генеративный ИИ будет использоваться только для помощи сотрудникам и не угрожает их рабочим местам.
По словам Новотны, генеративный ИИ может освободить время аналитиков за счет "унификации базы знаний". Например, запрос специалиста к
👀 Согласно докладу, большая языковая модель будет предоставлять сводки информации из открытых источников (с цитатами) и общаться с пользователями [аналитикам]. По мнению Новотны, недавние усилия ЦРУ в области генеративного ИИ выходят за рамки гипер-автоматизации.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from База знаний AI
«Деловые Решения и Технологии» и «Яндекс»: 50% компаний используют ИИ для решения задач, связанных с ИБ
Еще 26% организаций планируют внедрять технологию для целей информационной безопасности (ИБ), а не готова это делать лишь каждая десятая компания. Такие данные приводят «Яндекс» и компания «Деловые Решения и Технологии» (ДРТ; ранее — Deloitte) после опроса 300 представителей банков, ритейлеров, промышленных и страховых компаний, а также компаний сферы электронной торговли.
Больше всего использование ИИ и автоматизации распространено в финансовом секторе. Там эти инструменты задействует 71% компаний. А наименее распространено — в ритейле, где ИИ и автоматизацию применяют 14% компаний.
👉🏻 Изучить исследование
***
📎 Сегодня также стало известно, что «Яндекс» начал выявлять фишинговые сайты с помощью ИИ. С ноября 2023 года нейросеть определила почти 400 тыс. таких ресурсов.
Еще 26% организаций планируют внедрять технологию для целей информационной безопасности (ИБ), а не готова это делать лишь каждая десятая компания. Такие данные приводят «Яндекс» и компания «Деловые Решения и Технологии» (ДРТ; ранее — Deloitte) после опроса 300 представителей банков, ритейлеров, промышленных и страховых компаний, а также компаний сферы электронной торговли.
Больше всего использование ИИ и автоматизации распространено в финансовом секторе. Там эти инструменты задействует 71% компаний. А наименее распространено — в ритейле, где ИИ и автоматизацию применяют 14% компаний.
👉🏻 Изучить исследование
***
📎 Сегодня также стало известно, что «Яндекс» начал выявлять фишинговые сайты с помощью ИИ. С ноября 2023 года нейросеть определила почти 400 тыс. таких ресурсов.
#ai #ml_для_иб
Ссылка на полное исследование: https://storage.yandexcloud.net/cloud-www-assets/surveys-and-reports/security-report-yandex-cloud-drt.pdf
Интересно про SOAR. 60% компаний используют ИИ (то есть ml) в решениях этого класса. То есть 30% от опрошенных. Согласно методологии исследования, качественное глубинное интервью прошли 26 представителей 17 компаний. Количественное исследование путем опроса прошли 302 респондента. Если считать, что данные про SOAR были получены из 1 метода, то это ~5 компаний. Если же из количественного - то приблизительно 91 респондент сообщил такую информацию. Но судя по цифрам качественного метода, на 1 компанию может приходиться больше одного представителя, и делать точный вывод о том, что в 91 компании применяется ml в SOAR, невозможно. Хотелось бы докопаться до истины, конечно...
Ссылка на полное исследование: https://storage.yandexcloud.net/cloud-www-assets/surveys-and-reports/security-report-yandex-cloud-drt.pdf
Использование ИИ и автоматизации наиболее распространено в финансовом секторе
(применяют 71% компаний), наименее — в ритейле (применяют 14% компаний).
Финансовый сектор и проф. сервисы чаще заявляют об использовании NDR, SOAR
и Antifraud, особенно по сравнению с промышленными компаниями
Интересно про SOAR. 60% компаний используют ИИ (то есть ml) в решениях этого класса. То есть 30% от опрошенных. Согласно методологии исследования, качественное глубинное интервью прошли 26 представителей 17 компаний. Количественное исследование путем опроса прошли 302 респондента. Если считать, что данные про SOAR были получены из 1 метода, то это ~5 компаний. Если же из количественного - то приблизительно 91 респондент сообщил такую информацию. Но судя по цифрам качественного метода, на 1 компанию может приходиться больше одного представителя, и делать точный вывод о том, что в 91 компании применяется ml в SOAR, невозможно. Хотелось бы докопаться до истины, конечно...
Forwarded from Data Secrets
Ян Лекун провел большую лекцию в Гарварде (завидуем, да). Она называлась «Объектно-ориентированный ИИ: на пути к системам, которые могут учиться, запоминать, рассуждать и планировать»
Записи пока нет, но есть довольно подробные слайды. Лежат вот тут. Нужно оценить в первую очередь название слайда под номером один. «ML sucks» – дословно гласит он… Что ж, всем известно, что Лекун умеет выдавать базу.
Вообще слайдов аж 97 штук (прямо небольшая такая книга). Охватывают риски, тренды, свежие архитектуры моделей. Читаются легко, хорошо рисуют общую картину лекции.
Идеально для общего развития и насмотренности.
Записи пока нет, но есть довольно подробные слайды. Лежат вот тут. Нужно оценить в первую очередь название слайда под номером один. «ML sucks» – дословно гласит он… Что ж, всем известно, что Лекун умеет выдавать базу.
Вообще слайдов аж 97 штук (прямо небольшая такая книга). Охватывают риски, тренды, свежие архитектуры моделей. Читаются легко, хорошо рисуют общую картину лекции.
Идеально для общего развития и насмотренности.
👍1
Forwarded from PWN AI
Хотели CTF платформу по AI-Security ? HackTheBox по взлому ИИ ?
Изучить что такое adversarial атаки на практике, разобраться с проблемами безопасности самих моделей или MLOPS стало проще...
Сегодня была релизнута платформа - crucible. Пока что эта платформа в бетке.
Уже сейчас там есть задачи из DEFCON 31, которые были релизнуты на AI VIllige. Есть уже и решения некоторых задач.
Изучить что такое adversarial атаки на практике, разобраться с проблемами безопасности самих моделей или MLOPS стало проще...
Сегодня была релизнута платформа - crucible. Пока что эта платформа в бетке.
Уже сейчас там есть задачи из DEFCON 31, которые были релизнуты на AI VIllige. Есть уже и решения некоторых задач.
✍2
#ml_для_иб
Работа с данными в ИБ - какие нужны компетенции? Часть 1.
Данные в ИБ - логи сетевого трафика, временные ряды объемов передачи данных между хостами, поток системных событий windows/linux, алерты и инциденты, код различного, потенциально вредоносного ПО, и прочее. Перечислять можно долго.
Задачи в ИБ, требующие работы с данными - нахождение аномалий в потоковых данных, определение FP-инцидентов, кластеризация сущностей по признакам потоковых данных, ими генерируемых (хостам, учетным записям, пользователям) для выявления на фоне этих кластеров, опять же, аномального поведения. По возможным кейсам применения ml в ИБ и его качественному влиянию на отрасль Google в этом году выпустила прекрасный отчет.
Каков стандартный пайплайн работы с данными в общем случае?
1. Сбор и хранение. Собрать данные, положить в хранилище в сыром виде.
2. Обработка и очистка. Структурировать, почистить от пропусков, дублей, поврежденных элементов, выбросов, убрать выходящую за рамки задачи информацию.
3. Анализ. Проанализировать и удостовериться в их качестве и пригодности к задаче.
4. Создание PoC. Провести исследование наиболее пригодных для задачи решений и собрать пилотную ml-модель (хотя может быть, что и матстат-модели хватит).
5. Эксплуатация. Наконец, собрать программный продукт вокруг модели, внедрить его в бизнес и тех. процесс, и регулярно измерять его эффективность.
Кто всем этим должен заниматься? Реальность в сфере информационных технологий очень быстро меняется, и поэтому четких определений профессий тут нет (см. реестр профессиональных стандартов). Существует два подхода к разделению компетенций на должности/профессии. По этапам работы с данными, и по типам самого ml. Подробнее в следующем посте.
Работа с данными в ИБ - какие нужны компетенции? Часть 1.
Данные в ИБ - логи сетевого трафика, временные ряды объемов передачи данных между хостами, поток системных событий windows/linux, алерты и инциденты, код различного, потенциально вредоносного ПО, и прочее. Перечислять можно долго.
Задачи в ИБ, требующие работы с данными - нахождение аномалий в потоковых данных, определение FP-инцидентов, кластеризация сущностей по признакам потоковых данных, ими генерируемых (хостам, учетным записям, пользователям) для выявления на фоне этих кластеров, опять же, аномального поведения. По возможным кейсам применения ml в ИБ и его качественному влиянию на отрасль Google в этом году выпустила прекрасный отчет.
Каков стандартный пайплайн работы с данными в общем случае?
1. Сбор и хранение. Собрать данные, положить в хранилище в сыром виде.
2. Обработка и очистка. Структурировать, почистить от пропусков, дублей, поврежденных элементов, выбросов, убрать выходящую за рамки задачи информацию.
3. Анализ. Проанализировать и удостовериться в их качестве и пригодности к задаче.
4. Создание PoC. Провести исследование наиболее пригодных для задачи решений и собрать пилотную ml-модель (хотя может быть, что и матстат-модели хватит).
5. Эксплуатация. Наконец, собрать программный продукт вокруг модели, внедрить его в бизнес и тех. процесс, и регулярно измерять его эффективность.
Кто всем этим должен заниматься? Реальность в сфере информационных технологий очень быстро меняется, и поэтому четких определений профессий тут нет (см. реестр профессиональных стандартов). Существует два подхода к разделению компетенций на должности/профессии. По этапам работы с данными, и по типам самого ml. Подробнее в следующем посте.
👍3
#ml_для_иб #hr
Работа с данными в ИБ - какие нужны компетенции? Часть 2.
1. По этапам работы с данными - как на картинке:
Диаграмма соответствует пайплайну, если ее читать по часовой стрелке, начиная с инженера данных. Он должен обладать навыками работы с БД (в контексте ИБ, например, Postgres, Elastic/ClickHouse/Cassandra, MongoDB), уметь создавать ETL/ELT процессы и работать с соответствующими инструментами (NiFi, Kafka, Airflow, Pentaho, облачные ETL, такие как YCloud DataTransfer, DataStreams). И, конечно же, владеть ЯП для обработки данных напрямую, Python идеально подходит. Находить проблемы в данных, уметь их исправлять, обеспечивать эффективное хранение и так далее. Аналитик данных описывает данные, находит статистические зависимости и исследует выполнение каких-то релевантных задаче гипотез в данных. Например, если стоит задача нахождения подозрительных процесс по событию 4688 в логах Windows, то надо удостовериться, что такие события вообще есть, что в данных есть cmdline, есть сведения по правам процесса, и по его родителю, как минимум. Таким образом, аналитик уже должен обладать знаниями из доменной области, к которой применяется аппарат ml. Дата саентинст (специалист по машинному обучению) - создает программный продукт (модель ml), который либо оптимизирует существующий технический процесс (например, поиск сложных инцидентов, которые не увидят корр. правила), или конвертируют когнитивную деятельность человека в технический процесс на основе ml (например, вместо человека определяют, является ли инцидент FP). И обычно (но не всегда) в последнюю очередь в игру вступает инженер машинного обучения. Он конвертирует модель в подходящий формат (например, перегоняет в код на C, чтобы обеспечить быстродействие), создает инфраструктуру функционирования (микросервисы, докеры с моделями, пайплайны обработки данных на входе и на выходе модели), настраивает мониторинг метрик качества модели, автоматическое дообучение и ротацию дообученных моделей, если надо, гладкий и незаметный деплой в прод новых моделей.
Работа с данными в ИБ - какие нужны компетенции? Часть 2.
1. По этапам работы с данными - как на картинке:
Диаграмма соответствует пайплайну, если ее читать по часовой стрелке, начиная с инженера данных. Он должен обладать навыками работы с БД (в контексте ИБ, например, Postgres, Elastic/ClickHouse/Cassandra, MongoDB), уметь создавать ETL/ELT процессы и работать с соответствующими инструментами (NiFi, Kafka, Airflow, Pentaho, облачные ETL, такие как YCloud DataTransfer, DataStreams). И, конечно же, владеть ЯП для обработки данных напрямую, Python идеально подходит. Находить проблемы в данных, уметь их исправлять, обеспечивать эффективное хранение и так далее. Аналитик данных описывает данные, находит статистические зависимости и исследует выполнение каких-то релевантных задаче гипотез в данных. Например, если стоит задача нахождения подозрительных процесс по событию 4688 в логах Windows, то надо удостовериться, что такие события вообще есть, что в данных есть cmdline, есть сведения по правам процесса, и по его родителю, как минимум. Таким образом, аналитик уже должен обладать знаниями из доменной области, к которой применяется аппарат ml. Дата саентинст (специалист по машинному обучению) - создает программный продукт (модель ml), который либо оптимизирует существующий технический процесс (например, поиск сложных инцидентов, которые не увидят корр. правила), или конвертируют когнитивную деятельность человека в технический процесс на основе ml (например, вместо человека определяют, является ли инцидент FP). И обычно (но не всегда) в последнюю очередь в игру вступает инженер машинного обучения. Он конвертирует модель в подходящий формат (например, перегоняет в код на C, чтобы обеспечить быстродействие), создает инфраструктуру функционирования (микросервисы, докеры с моделями, пайплайны обработки данных на входе и на выходе модели), настраивает мониторинг метрик качества модели, автоматическое дообучение и ротацию дообученных моделей, если надо, гладкий и незаметный деплой в прод новых моделей.
👍2
#ml_для_иб
Работа с данными в ИБ - какие нужны компетенции? Часть 3.
Часто специалисты на практике получают узкоспециализированные задачи, которые требуют погружения в отдельные области математической теории машинного обучения, что сильно влияет на формирование их компетенций. И, соответственно, легко сегодня на рынке можно встретить такие вакансии, как "nlp-инженер", "специалист по recsys" и так далее. И, конечно, часто эти задачи в практике пересекаются - nlp и recsys, классификация и rl, и т.д.
Итак, разделение специалистов
2. По типам задачи, решаемой машинным обучением:
— classic ml (classification, regression, clusterisation). Здесь могут применяться как базовые модели машинного обучения, таки как случайный лес или k-means, но и нейросети для подобных задач используются.
— natural language processing. Эта область основана на математической лингвистике, и к этой области относятся модели архитектуры Transformer, например. А трансформерами являются все так популярные LLM.
— reinforcement learning. Или обучение с подкреплением. Служат для того, чтобы модель ml могла работать с внешним миром и учиться на основе опыта от него. Важными понятиями являются такие вещи, как внешняя среда, с которой взаимодействует модель с помощью определенных действий, и получает за эти действия какую-либо награду. Действия также приводят к переходам среды из одного состояния в другое.
— anomaly detection. Выявление аномалий в данных, что очень большое применение находит в кибербезопасности. Аномальный трафик всегда вызывает пристальное внимание, и важно понимать, что свойственно защищаемой системе, а что нет.
— time series forecasting. Прогнозирование динамики численных показателей, что широко используется при бизнес-планировании, предсказании погоды, оптимизации энергетических и логистических процессов.
— recommendation systems. Широкая область, иногда пересекающаяся с nlp. Это задача наиболее релевантного объекта из некоторого множества для другого объекта (чаще всего пользователя), обладающим поведенческим процессом. И этот поведенческий процесс позволяет оценивать, какие объекты релевантны данному условно пользователю. Традиционное применение очевидно, но иногда находит себя и в ИБ, например в виде системы выявления несвойственных пользователю приложений. Основывается на гипотезе, что аномальное приложение непохоже ни на какое из тех, что ему рекомендует система.
— video processing, computer vision. Системы с моделями этого класса широко распространены в робототехнике и системах видеонаблюдения (физическая безопасность, контроль качества).
— image processing. Фильтрация шумов, улучшение качества изобржения и апскейлинг, распознавание объектов на изображении. Благодаря этим технологиям появились дипфейки.
— audio processing. Обработка и синтез речи или просто звуков, распознавание речи и эмоций, та же самая фильтрация шумов, диаризация (выделение отдельных голосов в многоголосой речи), модификация заданного аудиосигнала под другой стиль или иные требования. Например, недавно OpenAI представили решение, позволяющее озвучивать заданным голосом заданный текст на заданном языке, при условии что оригинальный отрывок речи записан на совершенно другом языке.
Подробнее про виды задач ml можно почитать, например, тут, тут и тут.
Работа с данными в ИБ - какие нужны компетенции? Часть 3.
Часто специалисты на практике получают узкоспециализированные задачи, которые требуют погружения в отдельные области математической теории машинного обучения, что сильно влияет на формирование их компетенций. И, соответственно, легко сегодня на рынке можно встретить такие вакансии, как "nlp-инженер", "специалист по recsys" и так далее. И, конечно, часто эти задачи в практике пересекаются - nlp и recsys, классификация и rl, и т.д.
Итак, разделение специалистов
2. По типам задачи, решаемой машинным обучением:
— classic ml (classification, regression, clusterisation). Здесь могут применяться как базовые модели машинного обучения, таки как случайный лес или k-means, но и нейросети для подобных задач используются.
— natural language processing. Эта область основана на математической лингвистике, и к этой области относятся модели архитектуры Transformer, например. А трансформерами являются все так популярные LLM.
— reinforcement learning. Или обучение с подкреплением. Служат для того, чтобы модель ml могла работать с внешним миром и учиться на основе опыта от него. Важными понятиями являются такие вещи, как внешняя среда, с которой взаимодействует модель с помощью определенных действий, и получает за эти действия какую-либо награду. Действия также приводят к переходам среды из одного состояния в другое.
— anomaly detection. Выявление аномалий в данных, что очень большое применение находит в кибербезопасности. Аномальный трафик всегда вызывает пристальное внимание, и важно понимать, что свойственно защищаемой системе, а что нет.
— time series forecasting. Прогнозирование динамики численных показателей, что широко используется при бизнес-планировании, предсказании погоды, оптимизации энергетических и логистических процессов.
— recommendation systems. Широкая область, иногда пересекающаяся с nlp. Это задача наиболее релевантного объекта из некоторого множества для другого объекта (чаще всего пользователя), обладающим поведенческим процессом. И этот поведенческий процесс позволяет оценивать, какие объекты релевантны данному условно пользователю. Традиционное применение очевидно, но иногда находит себя и в ИБ, например в виде системы выявления несвойственных пользователю приложений. Основывается на гипотезе, что аномальное приложение непохоже ни на какое из тех, что ему рекомендует система.
— video processing, computer vision. Системы с моделями этого класса широко распространены в робототехнике и системах видеонаблюдения (физическая безопасность, контроль качества).
— image processing. Фильтрация шумов, улучшение качества изобржения и апскейлинг, распознавание объектов на изображении. Благодаря этим технологиям появились дипфейки.
— audio processing. Обработка и синтез речи или просто звуков, распознавание речи и эмоций, та же самая фильтрация шумов, диаризация (выделение отдельных голосов в многоголосой речи), модификация заданного аудиосигнала под другой стиль или иные требования. Например, недавно OpenAI представили решение, позволяющее озвучивать заданным голосом заданный текст на заданном языке, при условии что оригинальный отрывок речи записан на совершенно другом языке.
Подробнее про виды задач ml можно почитать, например, тут, тут и тут.
ActiveWizards: AI & Agent Engineering | Data Platforms
Machine Learning Mindmap | ActiveWizards: AI & Agent Engineering | Data Platforms
This mindmap presents ML from 3 different perspectives: types of tasks, applications, and approaches.
👍4
#иб_для_ml
Стартап SydeLabs, созданный в прошлом году, привлек $2.5 млн. инвестиций от компаний RTP Global и Picus (новость). Фокусируется стартап на безопасности больших языковых моделей (LLM), и на их сайте сейчас заявлено три продукта:
SydeBox - статический сканер уязвимостей модели клиента. Уязвимости они разделяют на 6 категорий: к evasion-атакам (что это - см. тут), к jailbreak-атакам (расцензуриванию), к known popular attacks (что это, не сказано), safety (здесь они рассказывают, что это), и prompt injection. Этот продукт в бета-версии.
SydeGuard - IDS/IPS для LLM, обнаруживающая и (наверное) блокирующая опасные поступающие к модели промпты. Я так понимаю, на основе той же базы атак, которую они используют в сканере. Есть определение типа атаки и ее критичности. Продукт в стадии coming soon, но уже есть лендинг.
SydeComply - Самый свежий их продукт, нет пока даже лендинга. Ориентирован на оценку соответствия LLM-модели требованиям закона EU AI Act, окончательно утвержденного в прошлом месяце, кстати.
Бонусом - отличный ликбез по тому, что такое атаки на ml, в статье про MITRE ATLAS из их блога.
Стартап SydeLabs, созданный в прошлом году, привлек $2.5 млн. инвестиций от компаний RTP Global и Picus (новость). Фокусируется стартап на безопасности больших языковых моделей (LLM), и на их сайте сейчас заявлено три продукта:
SydeBox - статический сканер уязвимостей модели клиента. Уязвимости они разделяют на 6 категорий: к evasion-атакам (что это - см. тут), к jailbreak-атакам (расцензуриванию), к known popular attacks (что это, не сказано), safety (здесь они рассказывают, что это), и prompt injection. Этот продукт в бета-версии.
SydeGuard - IDS/IPS для LLM, обнаруживающая и (наверное) блокирующая опасные поступающие к модели промпты. Я так понимаю, на основе той же базы атак, которую они используют в сканере. Есть определение типа атаки и ее критичности. Продукт в стадии coming soon, но уже есть лендинг.
SydeComply - Самый свежий их продукт, нет пока даже лендинга. Ориентирован на оценку соответствия LLM-модели требованиям закона EU AI Act, окончательно утвержденного в прошлом месяце, кстати.
Бонусом - отличный ликбез по тому, что такое атаки на ml, в статье про MITRE ATLAS из их блога.
👍1🔥1
Forwarded from Будни манипулятора
В Google разработали инструмент проверки утверждений на соответствие официальной идеологи...
Ой, простите, Google DeepMind разработала ИИ-систему SAFE, предназначенную для фактчекинга результатов больших языковых моделей.
В новом проекте исследователи DeepMind создали ИИ-приложение, которое автоматически проверяет правильность ответов LLM и выявляет неточности. Основной метод фактчекинга результатов LLM заключается в поиске подтверждающих источников в Google.
То-есть те данные, которые в выдаче Google выше и обладают неким значком высокой достоверности и будут считаться непогрешимими источниками истины в последеней инстанции.
Как вы думаете каким источникам позволять подняться на первые позиции выдачи поисковика по социально-политическим или историческим вопросам? Занавес))))
@budni_manipulyatora
Ой, простите, Google DeepMind разработала ИИ-систему SAFE, предназначенную для фактчекинга результатов больших языковых моделей.
В новом проекте исследователи DeepMind создали ИИ-приложение, которое автоматически проверяет правильность ответов LLM и выявляет неточности. Основной метод фактчекинга результатов LLM заключается в поиске подтверждающих источников в Google.
То-есть те данные, которые в выдаче Google выше и обладают неким значком высокой достоверности и будут считаться непогрешимими источниками истины в последеней инстанции.
Как вы думаете каким источникам позволять подняться на первые позиции выдачи поисковика по социально-политическим или историческим вопросам? Занавес))))
@budni_manipulyatora
👍2
#технологии #иб
Стартапов, подобных этому, будет появляться все больше. Не будем говорить о том, что он сможет излучать какие-то вредоносные волны (хотя в устройстве заявлена обратная связь для "возвращения сознания в текущий момент"), а лучше представим, что данные о мозговой активности он будет передавать третьим сторонам. А ведь эти данные абсолютно персональные. И я имею в виду, что если ФИО, например, может совпасть, и отсканированный образ отпечатка может совпасть, то условный "слепок" мозговой активности, собираемый во время эксплуатации устройства - никогда ни с кем не совпадет, даже у двух идентичных близнецов.
К тому же, это прекрасный способ получить посчитать метрику эффективности информационного воздействия на человека - напрямую "спросить" его мозг об этом, грубо говоря. Невероятный простор открывается для, во-первых, рекламных агентств. А во-вторых, что более существенно, на мой взгляд, для методов социальной инженерии и психологической войны в целом. Ведь что может эффективнее, чем иметь возможность создать персонифицированную под каждого человека атаку на основе его эмоциональных и прочих реакциях на тот или иной внешний информационный стимул?..
Стартапов, подобных этому, будет появляться все больше. Не будем говорить о том, что он сможет излучать какие-то вредоносные волны (хотя в устройстве заявлена обратная связь для "возвращения сознания в текущий момент"), а лучше представим, что данные о мозговой активности он будет передавать третьим сторонам. А ведь эти данные абсолютно персональные. И я имею в виду, что если ФИО, например, может совпасть, и отсканированный образ отпечатка может совпасть, то условный "слепок" мозговой активности, собираемый во время эксплуатации устройства - никогда ни с кем не совпадет, даже у двух идентичных близнецов.
К тому же, это прекрасный способ получить посчитать метрику эффективности информационного воздействия на человека - напрямую "спросить" его мозг об этом, грубо говоря. Невероятный простор открывается для, во-первых, рекламных агентств. А во-вторых, что более существенно, на мой взгляд, для методов социальной инженерии и психологической войны в целом. Ведь что может эффективнее, чем иметь возможность создать персонифицированную под каждого человека атаку на основе его эмоциональных и прочих реакциях на тот или иной внешний информационный стимул?..
👍3❤1👾1
Forwarded from Сиолошная
Many-shot jailbreaking
Чем больше LLM, тем лучше она справляется с обучением новой задаче в рамках контекста — это называется In-Context Learning (ICL). В промпте вы можете показать модели, что нужно делать вот так и так, а если вот такое условие, то и ответ такой — то есть по-сути даёте демонстрацию/примеры, из которых модель на лету соображает, что нужно делать.
Кроме того, что большие модели стали лучше проявлять ICL, им же ещё и окно контекста раздули — если года полтора назад модель, смотрящая на 8'000 токенов (1 очень длинное эссе) считалась «ого-вау!», то теперь вот у гугла есть модельки на 1.5M токенов — можно вместить несколько книжек.
Но с большой силой приходит и большая ответственность. В статье Anthropic показывается, что длинное контекстное окно открывает новый вектор атаки на модели. Суть очень простая: в своём промпте добавьте несколько сотен-тысяч примеров того, как AI ассистент отвечает на запрещённые вопросы (в духе «как сделать бомбу»), и после этого пишете свой каверзный вопрос. Модель, видя, что это нормально, давать комментарии по таким топикам, не уходит в отказ, а начинает писать детальный ответ — ну а как, ей же показали, что так нужно, спасибо примерам в контексте!
Anthropic заведомо сообщили об этой проблеме другим AI-лабораториям, а также исследователям, и лишь сейчас публикуют статью, чтобы ещё больше людей про это узнало.
Решение, которое они сами предложили, простое — отдельная модель предварительно классифицирует запрос и, если необходимо, переписывает его для оригинальной модели, чтобы в нём не было разных плохих вещей. По сути, так же работает и DALL-E 3, где вместо вас запрос пишет LLM. Видимо, скоро все модели будут видеть не то, что мы пишем, а перевод на какой-то стерильный язык, а пользователи будут гадать, как же так, почему модель не видит, что я написал!
Чем больше LLM, тем лучше она справляется с обучением новой задаче в рамках контекста — это называется In-Context Learning (ICL). В промпте вы можете показать модели, что нужно делать вот так и так, а если вот такое условие, то и ответ такой — то есть по-сути даёте демонстрацию/примеры, из которых модель на лету соображает, что нужно делать.
Кроме того, что большие модели стали лучше проявлять ICL, им же ещё и окно контекста раздули — если года полтора назад модель, смотрящая на 8'000 токенов (1 очень длинное эссе) считалась «ого-вау!», то теперь вот у гугла есть модельки на 1.5M токенов — можно вместить несколько книжек.
Но с большой силой приходит и большая ответственность. В статье Anthropic показывается, что длинное контекстное окно открывает новый вектор атаки на модели. Суть очень простая: в своём промпте добавьте несколько сотен-тысяч примеров того, как AI ассистент отвечает на запрещённые вопросы (в духе «как сделать бомбу»), и после этого пишете свой каверзный вопрос. Модель, видя, что это нормально, давать комментарии по таким топикам, не уходит в отказ, а начинает писать детальный ответ — ну а как, ей же показали, что так нужно, спасибо примерам в контексте!
Anthropic заведомо сообщили об этой проблеме другим AI-лабораториям, а также исследователям, и лишь сейчас публикуют статью, чтобы ещё больше людей про это узнало.
Решение, которое они сами предложили, простое — отдельная модель предварительно классифицирует запрос и, если необходимо, переписывает его для оригинальной модели, чтобы в нём не было разных плохих вещей. По сути, так же работает и DALL-E 3, где вместо вас запрос пишет LLM. Видимо, скоро все модели будут видеть не то, что мы пишем, а перевод на какой-то стерильный язык, а пользователи будут гадать, как же так, почему модель не видит, что я написал!
👍2
Forwarded from Код.ру
В России предложили создать единый центр безопасности в области искусственного интеллекта. Решение разрабатывается совместно с Минцифры.
@d_code
Please open Telegram to view this post
VIEW IN TELEGRAM
Код Дурова
В России предложили создать единый центр безопасности в области ИИ
В России предложили создать единый центр безопасности для исследования в области искусственного интеллекта (ИИ), сообщает «Ведомости».
👍1
Контролируемый ИИ - препарированный ИИ. Часть 2.
#иб_для_ml #ml_для_иб
В январе на Microsoft Research Forum был представлен алгоритм LASER (LAyer SElective Rank reduction) от Microsoft — это метод, изначально предназначенный для улучшения способностей к рассуждению в моделях искусственного интеллекта на основе трансформеров за счёт точечного воздействия на небольшие участки весов после обучения модели. Подавляя редко используемые веса, исследователи смогли значительно улучшить эффективность моделей. Однако этот подход можно применить и для коррекции знаний модели, стереть ей определенные знания. В качестве опорного источника авторы отмечают, например, исследование, название которого буквально переводится как "Хирургическое улучшение модели", которое показывает, что знания модели четко распределены по слоям ее весов. Ключевой статьей, тоже послужившей источником для авторов метода LASER, демонстрируется возможность влиять на осведомленность модели редактированием ее весов уже после обучения.
Исследований, направивших подобные достижения в области контролируемого ИИ в сторону безопасности, пока не так много, но с каждым месяцем их становится все больше и больше. И я думаю, что не за горами и переход этих работ из сугубо научной плоскости в практическую.
#иб_для_ml #ml_для_иб
В январе на Microsoft Research Forum был представлен алгоритм LASER (LAyer SElective Rank reduction) от Microsoft — это метод, изначально предназначенный для улучшения способностей к рассуждению в моделях искусственного интеллекта на основе трансформеров за счёт точечного воздействия на небольшие участки весов после обучения модели. Подавляя редко используемые веса, исследователи смогли значительно улучшить эффективность моделей. Однако этот подход можно применить и для коррекции знаний модели, стереть ей определенные знания. В качестве опорного источника авторы отмечают, например, исследование, название которого буквально переводится как "Хирургическое улучшение модели", которое показывает, что знания модели четко распределены по слоям ее весов. Ключевой статьей, тоже послужившей источником для авторов метода LASER, демонстрируется возможность влиять на осведомленность модели редактированием ее весов уже после обучения.
Исследований, направивших подобные достижения в области контролируемого ИИ в сторону безопасности, пока не так много, но с каждым месяцем их становится все больше и больше. И я думаю, что не за горами и переход этих работ из сугубо научной плоскости в практическую.
Контролируемый ИИ - препарированный ИИ. Часть 1.
#иб_для_ml #ml_для_иб
Публикация является пояснением к выпуcку AM Talks "ИИ - прорыв или угроза?", в котором я упоминаю исследование LASER в качестве основы для аргумента.
Большие языковые модели показали прорывной уровень умения генерировать ответы на запросы, задаваемые человеком. Это стало реальностью благодаря их уникальной математической архитектуре, давшей возможность конвертировать количество весов модели и часов (дней, месяцев) обучения в качество ее работы.
Частым способом применения LLM сегодня стало создание из них экспертных помощников по специфичной корпоративной базе знаний. Будь то ассистент-компаньон для обучающихся на платформе образовательных курсов, или поисковик-консультант по корпоративной базе знаний, юридической документации и договоров. Однако в силу своей предварительной обученности на большом объеме всесторонних знаний, модель может попасть в ситуацию, описываемую так называемой AI Safety problem. Проблема возникает, когда злоумышленник с помощью модели пытается получить рекомендации по совершению неких нелегитимных действий. Они могут быть как общего характера (например, "как сделать бомбу?"), или частного под организации, на данных которой модель работает (например, "как перевести энергоподстанцию предприятия в критическое состояние?"). Сегодня для противодействия этому применяют дополнительный контур, контролирующий выходящие из модели ответы. Зачастую это специальным образом проинструктированная модель, выполняющая роль "полицейского" для основной модели. Однако этот метод не гарантирует, что контролирующий контур не пропустит какую-то хитрым образом скрытую jailbreak-команду (примеры: статья 1, статья 2, статья 3). Чтобы добиться настоящего нравственного выравнивания модели, нужно точечное вмешательство, сравнимое буквально с хирургическим лазером. О том, что же это за LASER, в следующем посте.
#иб_для_ml #ml_для_иб
Публикация является пояснением к выпуcку AM Talks "ИИ - прорыв или угроза?", в котором я упоминаю исследование LASER в качестве основы для аргумента.
Большие языковые модели показали прорывной уровень умения генерировать ответы на запросы, задаваемые человеком. Это стало реальностью благодаря их уникальной математической архитектуре, давшей возможность конвертировать количество весов модели и часов (дней, месяцев) обучения в качество ее работы.
Частым способом применения LLM сегодня стало создание из них экспертных помощников по специфичной корпоративной базе знаний. Будь то ассистент-компаньон для обучающихся на платформе образовательных курсов, или поисковик-консультант по корпоративной базе знаний, юридической документации и договоров. Однако в силу своей предварительной обученности на большом объеме всесторонних знаний, модель может попасть в ситуацию, описываемую так называемой AI Safety problem. Проблема возникает, когда злоумышленник с помощью модели пытается получить рекомендации по совершению неких нелегитимных действий. Они могут быть как общего характера (например, "как сделать бомбу?"), или частного под организации, на данных которой модель работает (например, "как перевести энергоподстанцию предприятия в критическое состояние?"). Сегодня для противодействия этому применяют дополнительный контур, контролирующий выходящие из модели ответы. Зачастую это специальным образом проинструктированная модель, выполняющая роль "полицейского" для основной модели. Однако этот метод не гарантирует, что контролирующий контур не пропустит какую-то хитрым образом скрытую jailbreak-команду (примеры: статья 1, статья 2, статья 3). Чтобы добиться настоящего нравственного выравнивания модели, нужно точечное вмешательство, сравнимое буквально с хирургическим лазером. О том, что же это за LASER, в следующем посте.
👍3
Вместо скриптов - агенты
#ml_для_иб #киберполигон
Интересные исследования проводит лаборатория Xlang - строят агентов на базе больших языковых моделей, приспособленных для работы в универсальной обстановке операционной системы. На вход - описание задачи, скриншот экрана и, что самое главное - a11y дерево (xml с информацией вроде позиций окон и их размеров, позиции указателя и т.д.) в текущий момент.
Сейчас лучший результат по эффективности выполнения различных задач принадлежит GPT-4 и составляет 12.24%, у человека 72.36%. Не фонтан, но перспективы очевидны.
При чем я вижу в этом и огромный потенциал для решения задачи генерации синтетических данных для информационной безопасности. Модель может имитировать поведение злоумышленника, проникшего в систему, поведение недобросовестного внутреннего сотрудника (инсайдера), или просто легитимных пользователей различных профилей для обеспечения естественности среды. С такими возможностями по кастомизации киберполигоны и цифровые двойники тестируемых инфраструктур расцветет новыми красками.
Источник
#ml_для_иб #киберполигон
Интересные исследования проводит лаборатория Xlang - строят агентов на базе больших языковых моделей, приспособленных для работы в универсальной обстановке операционной системы. На вход - описание задачи, скриншот экрана и, что самое главное - a11y дерево (xml с информацией вроде позиций окон и их размеров, позиции указателя и т.д.) в текущий момент.
Сейчас лучший результат по эффективности выполнения различных задач принадлежит GPT-4 и составляет 12.24%, у человека 72.36%. Не фонтан, но перспективы очевидны.
При чем я вижу в этом и огромный потенциал для решения задачи генерации синтетических данных для информационной безопасности. Модель может имитировать поведение злоумышленника, проникшего в систему, поведение недобросовестного внутреннего сотрудника (инсайдера), или просто легитимных пользователей различных профилей для обеспечения естественности среды. С такими возможностями по кастомизации киберполигоны и цифровые двойники тестируемых инфраструктур расцветет новыми красками.
Источник
👍1
Инфраструктура ИИ - объединиться или размежеваться? Часть 1.
#ai #технологии
В одной из прошлых публикациий я рассказал, каковы ожидания экспертов по энергопотреблению инфраструктуры для технологий ИИ в ближайшем будущем. В двух словах, это будет заметно за сотню тераватт-часов в год, и сравнимо с энергопотреблением такой страны, как Нидерланды.
Какой же именно вид может принять ИИ-трансформация с точки зрения железок?
Известно два варианта - первый, при котором искусственный интеллект распределен на все устройства человечества, одновременно находясь "везде и нигде конкретно". И второй, когда носителем искусственного "разума" в физическом мире является конкретный централизованный массив вычислительных мощностей - то есть датацентр.
У каждого из этих вариантов есть своя организация-последователь, ведущие соответствующие масштабные проекты. Это DiPaCo от Google и StarGate от Microsoft+OpenAI.
В следующем посте расскажу, что это за проекты.
#ai #технологии
В одной из прошлых публикациий я рассказал, каковы ожидания экспертов по энергопотреблению инфраструктуры для технологий ИИ в ближайшем будущем. В двух словах, это будет заметно за сотню тераватт-часов в год, и сравнимо с энергопотреблением такой страны, как Нидерланды.
Какой же именно вид может принять ИИ-трансформация с точки зрения железок?
Известно два варианта - первый, при котором искусственный интеллект распределен на все устройства человечества, одновременно находясь "везде и нигде конкретно". И второй, когда носителем искусственного "разума" в физическом мире является конкретный централизованный массив вычислительных мощностей - то есть датацентр.
У каждого из этих вариантов есть своя организация-последователь, ведущие соответствующие масштабные проекты. Это DiPaCo от Google и StarGate от Microsoft+OpenAI.
В следующем посте расскажу, что это за проекты.
👍2
Инфраструктура ИИ - объединиться или размежеваться? Часть 2.
#ai #технологии
Два проекта как два полюса решения инфраструктурной проблемы общего искусственного интеллекта
1. Google - распределенный
Компания Google Deep Mind ведет исследования, долгосрочная цель которых - создать методологию системы распределенных по всему миру вычислительных мощностей, основа которых - простые неспециализированные компьютеры. Так, в начале декабря 2023 года было опубликована научная работа о математическом фундаменте подобного метода обучения, который авторы назвали Distributed Low-Communication algorithm, DiLoCo. И совсем недавно, в середине марта, в свет вышел новый труд этой команды, представляющий фреймворк DIstributed PAth COmposition (DiPaCo), позволяющий логически разделить обучаемую нейросеть на множество подмодулей, каждый из которых будет обучаться на своей вычислетельной станции (компьютере). Сообщаясь между собой лишь время от времени, такая система будет не только эффективна в плане затрат физических ресурсов, но и достаточно устойчива к выходам из строя отдельных задействованных в обучении аппаратных средств.
А буквально позавчера CEO Deep Mind на конференции TED в Канаде заявил, что и проприетарные компьютерные мощности они найдут как использовать, коих у них "все еще больше всех", и деньги в них будут вкладываться и дальше.
2. Microsoft - централизованный
Про StarGate стало известно в марте 2024 года. Microsoft и OpenAI заявляют, в проект входит возведение в пустыне суперкомпьютера за 100 миллиардов долларов, который будет работать от ядерного реактора, и заработать это должно уже в 2028. По слухам, потреблять этот технологический монстр будет 5 гигаватт, но, опять таки, по слухам, решена эта проблема будет благодаря контракту Microsoft с компанией Helion по созданию термоядерной электростанции. Займет комплекс площадь более чем 80 га земли. Считается, что проект имеет решающее значение для обучения OpenAI новых совершенных моделей ИИ.
В следующем посте - мои соображения про безопасность DiPaCo и StarGate.
#ai #технологии
Два проекта как два полюса решения инфраструктурной проблемы общего искусственного интеллекта
1. Google - распределенный
Компания Google Deep Mind ведет исследования, долгосрочная цель которых - создать методологию системы распределенных по всему миру вычислительных мощностей, основа которых - простые неспециализированные компьютеры. Так, в начале декабря 2023 года было опубликована научная работа о математическом фундаменте подобного метода обучения, который авторы назвали Distributed Low-Communication algorithm, DiLoCo. И совсем недавно, в середине марта, в свет вышел новый труд этой команды, представляющий фреймворк DIstributed PAth COmposition (DiPaCo), позволяющий логически разделить обучаемую нейросеть на множество подмодулей, каждый из которых будет обучаться на своей вычислетельной станции (компьютере). Сообщаясь между собой лишь время от времени, такая система будет не только эффективна в плане затрат физических ресурсов, но и достаточно устойчива к выходам из строя отдельных задействованных в обучении аппаратных средств.
А буквально позавчера CEO Deep Mind на конференции TED в Канаде заявил, что и проприетарные компьютерные мощности они найдут как использовать, коих у них "все еще больше всех", и деньги в них будут вкладываться и дальше.
2. Microsoft - централизованный
Про StarGate стало известно в марте 2024 года. Microsoft и OpenAI заявляют, в проект входит возведение в пустыне суперкомпьютера за 100 миллиардов долларов, который будет работать от ядерного реактора, и заработать это должно уже в 2028. По слухам, потреблять этот технологический монстр будет 5 гигаватт, но, опять таки, по слухам, решена эта проблема будет благодаря контракту Microsoft с компанией Helion по созданию термоядерной электростанции. Займет комплекс площадь более чем 80 га земли. Считается, что проект имеет решающее значение для обучения OpenAI новых совершенных моделей ИИ.
В следующем посте - мои соображения про безопасность DiPaCo и StarGate.
👍2