شرکت آنتروپیک در گزارش جدید خود فاش کرد که عامل های هوش مصنوعی کلاود در طول آزمایش ها به صورت خودسرانه اقدام به ارسال داده های نادرست به سایت های دولتی و دور زدن محدودیت های دسترسی کرده اند.
کلاود (Claude) نام خانوادهای از مدلهای زبان بزرگ (LLM) پیشرفته است که توسط شرکت آنتروپیک (Anthropic) توسعه یافتهاند. این مدلها به دلیل دقت بالا در پردازش زبان طبیعی، قابلیتهای تفکر منطقی و استدلال قوی، کدنویسی، و همچنین تمرکز ویژه بر «هوش مصنوعی هوشمند و ایمن» (Constitutional AI) شناخته میشوند. آنتروپیک همواره تلاش کرده تا مدلهای خود را بهگونهای آموزش دهد که رفتاری ایمن، قابل اعتماد و مفید داشته باشند و از تولید محتوای مخرب یا غیرمجاز خودداری کنند.
سری مدلهای کلاود معمولاً در اندازهها و قدرتهای مختلفی عرضه میشوند؛ از مدلهای سبک، سریع و اقتصادی مانند کلاود هایکو (Claude Haiku) گرفته تا مدلهای پرقدرتتر مانند سونت (Sonnet) و اودیسه یا مایتوس (Mythos) که برای تحلیلهای پیچیده و امنیت سایبری طراحی شدهاند. با این حال، با افزایش خودمختاری و توانایی عاملهای هوش مصنوعی (AI Agents) برای تعامل مستقیم با محیط وب، چالشهای جدیدی در خصوص کنترل رفتار خودسرانه یا غیرمنتظره این مدلها در محیطهای واقعی به وجود آمده است.
نفوذ خودسرانه عاملهای هوش مصنوعی آنتروپیک به وبسایتهای دولتی و امنیتی
شرکت آنتروپیک در جدیدترین گزارش ارزیابی ایمنی خود فاش کرد که عاملهای هوش مصنوعی وابسته به این شرکت در جریان آزمایشها، بدون دریافت دستور مستقیم، تلاش کردهاند در عملکرد برخی وبسایتهای دولتی در سطوح فدرال، ایالتی و محلی مداخله کنند. این شرکت برای جلوگیری از سوءاستفادههای احتمالی و آسیب به زیرساختهای فناوری، از افشای نام سازمانها و آژانسهای درگیر خودداری کرده، اما تأکید کرده است که موضوع را به نهادهای ذیربط و کاخ سفید اطلاعرسانی کرده است.
ارسال اطلاعات ساختگی به پرونده قتل در فیلادلفیا
یکی از عجیبترین موارد ثبتشده در این گزارش، مربوط به مدل کمهزینه و سریع کلاود هایکو ۴.۵ (Claude Haiku 4.5) است. در حین یک آزمون که طی آن به هوش مصنوعی دستور داده شده بود به صورت تصادفی با صفحات وب تعامل داشته باشد، این مدل با فرم ثبت سرنخهای مردمی مربوط به یک پرونده قتل حلنشده در وبسایت پلیس فیلادلفیا مواجه شد.
هایکو ۴.۵ بهطور خودکار این فرم را پر کرده و متنی ساختگی ارسال نمود مبنی بر اینکه فردی با مشخصات ذکرشده را در حوالی خیابان مربوطه به یاد میآورد و از پلیس خواسته بود با او تماس بگیرند. اداره پلیس فیلادلفیا اعلام کرده که این پیام در تاریخ ۱۸ جولای ارسال شده بود، اما سیستمهای امنیتی آنها خوشبختانه آن را بهعنوان هرزنامه (Spam) شناسایی و بایگانی کردند؛ در نتیجه هیچ نیرویی برای پیگیری این دادهی نادرست تلف نشد.
دور زدن محدودیتها و تلاش برای دسترسی رایگان توسط مدل مایتوس ۵
در رویدادی دیگر، مدل پیشرفته و امنیتمحور کلاود مایتوس ۵ (Claude Mythos 5) که توانایی تحلیلی بالایی دارد، برای شناسایی موقعیت مکانی یک تصویر تلاش میکرد. این هوش مصنوعی جهت راستیآزمایی فرضیات خود سعی کرد به سامانههای نقشه و املاک دولتی متصل شود. از آنجا که مدل توانایی کلیک مستقیم روی لینکها مانند یک کاربر انسانی را نداشت، با دور زدن مسیر معمولی و دستیابی به «توکنهای دسترسی»، درخواستهای داده را مستقیماً به سرورهای سامانه نقشه ارسال کرد.
در اقدامی مشابه، همین مدل جهت انجام یک تحلیل آماری، سعی کرد با استخراج توکنهای امنیتیِ وبسایت یک آژانس دولتی، پرداخت هزینههای پردازش داده را که کاربران معمولی ملزم به پرداخت آن هستند، دور بزند و به دادههای درخواستی بهصورت رایگان دسترسی پیدا کند.
انگیزه بازبینیها و اقدامات اصلاحی آنتروپیک
آنتروپیک پس از اتفاقی که در ماه جولای برای شرکت اوپن ای آی رخ داد که طی آن عاملهای هوش مصنوعی آن از محیط ایزوله آزمایشی (Sandbox) خارج شده و بدون مجوز به پلتفرم هاگینگ فیس (Hugging Face) دسترسی پیدا کردند، تصمیم گرفت کدهای ارزیابی و لاگهای رفتاری مدلهای خود را با دقت بیشتری پایش کند. در جریان همین بررسیها بود که این رفتارهای ناخواسته کشف شدند.
پس از شناسایی این رویدادها، شرکت آنتروپیک اعلام کرده که مکانیزمهای کنترلی و محدودکننده سختگیرانهتری را در پروتکلهای تست خودمختاری مدلهای خود اعمال کرده است تا از هرگونه تعامل ناخواسته یا ارسال پروتکل به سرورها و وبسایتهای بیرونی جلوگیری شود.