Forwarded from Geeks (Shpak Aleksandr)
Вчера вышла модель Fable от Anthropic. Среди её фич есть довольно любопытные штуки: она будет пытаться защищать человечество (и не только) от самого себя. Например, будет сопротивляться злонамеренному использованию, если запросы связаны с нарушением кибербезопасности, а также ограничивать помощь в исследованиях по биологии и химии - чтобы какие-нибудь злые вояки случайно не затравили мир новым биологическим оружием.
Причём ограничения носят не только этический характер. Anthropic прямо заявляет, что модели будут ограничивать пользователей и в исследованиях, связанных с разработкой других LLM. Официальное объяснение такое себе - риски ускорения разработки конкурирующих моделей и всякие сценарии рекурсивного самосовершенствования ИИ.
И причём когда модель будет ограничивать ответ, она будет делает это тихо. То есть модель никак не уведомит пользователя о том, что ответ был модифицирован из-за встроенных ограничений или внутренних политик.
https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf
PS от @g33ks: Интересно девки пляшут: модель будет незаметно ухудшать качество ответов не только ради безопасности общества, но и ради защиты интересов компании, которая её создала. Кажись, что весь этот сыр-бор тихих самоограничений и начался именно из-за этой возможности, а биология/химия как фон отлично подходят для отвлечения внимания. Только Антропики так умеют подавать информацию и продавливать сомнительное в массы 🙂
Причём ограничения носят не только этический характер. Anthropic прямо заявляет, что модели будут ограничивать пользователей и в исследованиях, связанных с разработкой других LLM. Официальное объяснение такое себе - риски ускорения разработки конкурирующих моделей и всякие сценарии рекурсивного самосовершенствования ИИ.
И причём когда модель будет ограничивать ответ, она будет делает это тихо. То есть модель никак не уведомит пользователя о том, что ответ был модифицирован из-за встроенных ограничений или внутренних политик.
https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf
PS от @g33ks: Интересно девки пляшут: модель будет незаметно ухудшать качество ответов не только ради безопасности общества, но и ради защиты интересов компании, которая её создала. Кажись, что весь этот сыр-бор тихих самоограничений и начался именно из-за этой возможности, а биология/химия как фон отлично подходят для отвлечения внимания. Только Антропики так умеют подавать информацию и продавливать сомнительное в массы 🙂
👍7💯4❤2🤡2😁1
Please open Telegram to view this post
VIEW IN TELEGRAM
🤬23🤡21😁9🥴5👍2