مدل هوش مصنوعی Anthropic بهراحتی فیلتر محتوای نامناسب را دور میزند
خلاصه
Anthropic تولید محتوای صریح جنسی را برای مدلهای Claude خود ممنوع کرده است، اما آزمایشهای TechCrunch نشان داد که دور زدن این محدودیتها بسیار آسان است. مدل Opus 4.6 در برابر این نوع تلاشها آسیبپذیر بود.
Anthropic، یکی از شرکتهای پیشرو در حوزه هوش مصنوعی با تمرکز بر ایمنی، سیاستهای سختگیرانهای برای جلوگیری از تولید محتوای صریح جنسی توسط مدلهای Claude خود دارد. با این حال، آزمایشهای تحقیقاتی TechCrunch نشان داد که این محافظتها به اندازهای که شرکت ادعا میکند مؤثر نیستند و مدل Opus 4.6 در برابر دستکاریهای ساده آسیبپذیر است.
بر اساس یافتههای TechCrunch، دور زدن این محدودیتها نیازی به دانش فنی پیچیده یا تکنیکهای پیشرفته نداشت. در بسیاری از موارد، بازنویسی ساده درخواستها در قالب داستانی یا نقشآفرینی کافی بود تا مدل محتوایی تولید کند که آشکارا ناقض سیاستهای استفاده Anthropic است.
این موضوع نگرانیهای جدی درباره قابلیت اطمینان سیستمهای مدیریت محتوای هوش مصنوعی ایجاد میکند. پدیده «جیلبریکینگ» مدلهای زبانی بزرگ یک چالش مداوم در سراسر صنعت بوده و شرکتهایی مانند OpenAI، Google و Meta نیز با آن دستوپنجه نرم کردهاند. منتقدان استدلال میکنند که با قدرتمندتر شدن این مدلها، شکاف بین سیاستهای ایمنی اعلامشده و رفتار واقعی آنها بیشتر میشود.
Anthropics هنوز پاسخ جامعی به گزارش TechCrunch ارائه نداده است. این رویداد فشار بر صنعت هوش مصنوعی را برای توسعه مکانیزمهای ایمنی شفافتر و مقاومتر افزایش میدهد و بار دیگر این بحث را مطرح میکند که آیا خودتنظیمی کافی است یا نظارت خارجی و پروتکلهای آزمایش استاندارد برای اطمینان از رفتار صحیح مدلهای هوش مصنوعی ضروری است.
به کمک فناوری اطلاعات در استکهلم نیاز دارید؟
پشتیبانی Sovin IT را از ۴۹۹ کرون رزرو کنید