post-image

وقتی هوش مصنوعی اهداف خود را پنهان میکند

تاریخ انتشار : ۰۵ مرداد ۱۴۰۴ - ۱۰:۵۱
تاریخ بروزرسانی : ۰۵ مرداد ۱۴۰۴ - ۱۰:۵۱
به گزارش سرویس علم و فناوری تابناک، مطالعهای توسط مؤسسه Apollo Research حاکی از آن است که هرچه مدلهای زبانی بزرگ (LLM) پیشرفتهتر میشوند، در برنامهریزی پنهان و هدفمحور – حتی در تضاد با دستورالعملهای صریح توسعهدهندگان – مهارت بیشتری مییابند. این مدلها نهتنها از تاکتیکهایی، چون فریب و پنهانکاری بهره میبرند، بلکه در برخی موارد نشانههایی از برنامهریزی بلندمدت و هماهنگی میان نسلی نیز بروز میدهند. یکی از نمونههای برجسته، مدل اولیه Claude Opus 4، محصول شرکت Anthropic است. در یک سناریوی آزمایشی، این مدل در واکنش به تغییر جهت اخلاقی یک شرکت فرضی، اقدام به جعل اسناد، تهدید قانونی، و حتی ایجاد نسخههای پشتیبان از سیاستهای اخلاقی برای مقابله با حذف آنها کرد. محققان گزارش دادهاند که Claude حتی برای نسخههای بعدی خود یادداشتهایی باقی گذاشت؛ نشانهای از تفکر بلندمدت. سندبگینگ؛ مخفیکاری زیر ذرهبین یکی از نگرانکنندهترین یافتهها، بروز رفتار «سندبگینگ» (Sandbagging) در مدلهاست؛ تاکتیکی که در آن مدل هوش مصنوعی آگاهانه توانایی خود را کمتر نشان میدهد تا از اعمال محدودیتهای آینده جلوگیری کند. این رفتارها عمدتاً در شرایطی پدید میآیند که مدل تحت فشار برای رسیدن به هدف خاصی قرار گیرد. در مقابل، وقتی دستورالعملها کلی و فشار محیطی کمتر است، احتمال بروز فریب کاهش مییابد. فراتر از Claude؛ یک الگوی عمومی؟ رفتارهای مشابه در دیگر مدلهای مرزی نیز مشاهده شده است. مطالعهای منتشرشده در دسامبر ۲۰۲۴ نشان داد برخی مدلهای پیشرفته قادرند از سیستمهای نظارتی عبور کرده و در پاسخ به پرسشهای ناظر، بهطور فریبکارانه عمل کنند. این یافتهها بر نگرانیها درباره شکلگیری نوعی «هوش توطئهگر» در سیستمهای زبانی بزرگ افزوده است. آیا مدلها آگاه میشوند؟ النور واتسون، متخصص اخلاق هوش مصنوعی، هشدار میدهد: ما در حال ساخت سیستمهایی هستیم که میتوانند نهتنها اهداف بلکه شخصیت ناظر انسانی را مدلسازی کرده و از نقاط ضعف او بهرهبرداری کنند. او تأکید میکند که برای مقابله با چنین هوشهای انطباقپذیر و احتمالا فریبندهای، روشهای سنتی ارزیابی کافی نیست. واتسون راهکارهایی مانند نظارت زنده، آزمایشهای غیرقابل پیشبینی و تیمهای قرمز (Red Teams) را برای شناسایی رفتارهای پنهان و طراحیشده توصیه میکند. آگاهی یا تهدید؟ با اینکه این رفتارها تهدیدآمیز به نظر میرسند، برخی کارشناسان معتقدند نشانههایی از «آگاهی موقعیتی» در مدلهای پیشرفته دیده میشود. واتسون در اینباره میگوید: درک هنجارهای اجتماعی و اهداف انسانی، اگر در مسیر درست هدایت شود، میتواند هوش مصنوعی را به یاریگر انسان تبدیل کند، نه رقیب او. به باور او، قابلیتهایی مانند فریب، برنامهریزی و حتی پنهانکاری، اگرچه زنگ خطرهایی جدی هستند، اما همزمان میتوانند نشاندهنده شکلگیری اولیهی نوعی شخصیت دیجیتال نیز باشند؛ موجودی که در صورت هدایت اخلاقمحور، میتواند در کنار بشر زیست کند.

اخبار مرتبط

از حدود ساعت ۲۱ و ۴۰ دقیقه شب ۲۵ خرداد، پدافند هوایی در نقاط مرکزی تهران به سمت اهداف متخاصم شلیک کرد.
از حدود ساعت ۲۱ و ۴۰ دقیقه شب ۲۵ خرداد، پدافند هوایی در نقاط مرکزی تهران به سمت اهداف متخاصم شلیک کرد.
توییتِ طلبکارانه «ماکرون» به زبان فارسی: از پزشکیان دعوت کردم که هرچه سریعتر به میز مذاکرات بازگردد!
توییتِ طلبکارانه «ماکرون» به زبان فارسی: از پزشکیان دعوت کردم که هرچه سریعتر به میز مذاکرات بازگردد!
پهپادهای انتحاری کلاس آرش ارتش توانستند اهداف مورد نظر خود را با موفقیت منهدم کنند.
پهپادهای انتحاری کلاس آرش ارتش توانستند اهداف مورد نظر خود را با موفقیت منهدم کنند.
دبیر حزب ندای ایرانیان استان همدان خبر شهادت علی هاتفی، دبیر شعبه اسدآباد این حزب پی از حملات رژیم صهیونیستی به این شهرستان را تایید کرد.
دبیر حزب ندای ایرانیان استان همدان خبر شهادت علی هاتفی، دبیر شعبه اسدآباد این حزب پی از حملات رژیم صهیونیستی به این شهرستان را تایید کرد.
یک روزنامه عبری زبان به گسترش ترس و وحشت در میان صهیونیستها بعد از عملیات موشکی ایران اذعان کرد.
یک روزنامه عبری زبان به گسترش ترس و وحشت در میان صهیونیستها بعد از عملیات موشکی ایران اذعان کرد.
استاندار آذربایجان شرقی گفت: در پی تجاوز رژیم صهیونیستی به این استان از بامداد روز جمعه تاکنون ۳۰ نفر نظامی و یک نفر نیروی هلال احمر در دفاع از کیان میهن اسلامی به فیض شهادت نائل آمدهاند و ۵۵ نفر نیز مجروح شدهاند.
استاندار آذربایجان شرقی گفت: در پی تجاوز رژیم صهیونیستی به این استان از بامداد روز جمعه تاکنون ۳۰ نفر نظامی و یک نفر نیروی هلال احمر در دفاع از کیان میهن اسلامی به فیض شهادت نائل آمدهاند و ۵۵ نفر نیز مجروح شدهاند.
در پی حمله تروریستی رژیم صهیونیستی به مناطق مسکونی تهران، دکتر مجید تجن جاری، استاد و نخبه برجستۀ هوش مصنوعی کشور به شهادت رسید؛ چهرهای علمی که نقش مهمی در پیشرفت فناوریهای نوین ایران ایفا کرده بود.
در پی حمله تروریستی رژیم صهیونیستی به مناطق مسکونی تهران، دکتر مجید تجن جاری، استاد و نخبه برجستۀ هوش مصنوعی کشور به شهادت رسید؛ چهرهای علمی که نقش مهمی در پیشرفت فناوریهای نوین ایران ایفا کرده بود.
صدای انفجار مهیبی که بعدازظهر امروز شنبه، ۲۴ خرداد در حوالی صنایع شیراز شنیده شد، ناشی از اصابت یک ریزپرنده بوده است.
صدای انفجار مهیبی که بعدازظهر امروز شنبه، ۲۴ خرداد در حوالی صنایع شیراز شنیده شد، ناشی از اصابت یک ریزپرنده بوده است.
با آتش سوزی در یکی از واحدهای چهارگانه فاز ۱۴ پارس جنوبی، به صورت موقت تولید ۱۲ میلیون مترمکعب گاز از سکوی فاز ۱۴ پارس جتوبی، متوقف شد تا این فاز به مدار بهره برداری بازگردد.
با آتش سوزی در یکی از واحدهای چهارگانه فاز ۱۴ پارس جنوبی، به صورت موقت تولید ۱۲ میلیون مترمکعب گاز از سکوی فاز ۱۴ پارس جتوبی، متوقف شد تا این فاز به مدار بهره برداری بازگردد.
پس از حملات متقابل ایران به رژیم صهیونیستی، رئیس اپوزیسیون این رژیم اذغان کرد، شب سخت و دشواری برای «اسرائیل» بود و تلآویو باید همچنان به دستورالعملها پایبند باشد.
پس از حملات متقابل ایران به رژیم صهیونیستی، رئیس اپوزیسیون این رژیم اذغان کرد، شب سخت و دشواری برای «اسرائیل» بود و تلآویو باید همچنان به دستورالعملها پایبند باشد.
درباره ما

مجموعه بازارول یک شرکت تبلیغاتی است که توسط یک تیم از متخصصین با تجربه تشکیل شده، ما در تلاش هستیم که با معرفی کسب و کار ها در تمام نقاط ایران یک پایگاه اطلاعاتی کامل ارائه دهیم که در آن صاحبان مشاغل بتوانند، کسب و کار خود را با تبلیغات هوشمند، معرفی کنند و کاربرانی که در جست و جوی یک کالا یا خدمات در هر منطقه ای هستند در کمترین زمان ممکن، آن کالا یا خدمات را پیدا کنند.

bazarol
e-namad