آیا هوش مصنوعی میتواند از پاسخ نامطمئن خودداری کند؟

پژوهشگران گوگل دیپمایند در یک آزمایش چهارمرحلهای نشان دادند مدلهای زبانی بزرگ میتوانند میزان اطمینان خود به پاسخها را ارزیابی کنند و در صورت کافی نبودن اطمینان، از ارائه پاسخ خودداری کنند؛ قابلیتی که به کاهش پاسخهای گمراهکننده و افزایش اعتمادپذیری هوش مصنوعی کمک میکند.
به گزارش سیناپرس، مدلهای زبانی بزرگ (اِلاِلاِمها) همان سامانههای هوش مصنوعی هستند که پشت سکوهای گفتوگویی مانند چَتجیپیتی و جمینای قرار دارند. از این مدلها انتظار میرود بدون نظارت متخصصان انسانی به پرسشها پاسخ دهند، متن تولید کنند و تصمیم بگیرند؛ اما پژوهشهای گذشته نشان میدهد این مدلها گاهی کاربران را گمراه میکنند و پاسخهایی نامطمئن ارائه میدهند؛ پاسخهایی که در آنها به گزارههای نادرست یا نادقیق، اطمینان زیادی ابراز میشود.
اگر این مدلها بتوانند تشخیص دهند چقدر به پاسخشان اطمینان دارند و در صورت نداشتن اطمینان کافی پاسخ ندهند، این توانایی میتواند بسیار مفید باشد. مدلهای مختلف میتوانند میزان اطمینان خود به یک اطلاعات خاص را حدس بزنند؛ اما هنوز مشخص نیست این حدسها چقدر بر تصمیم آنها برای پاسخدادن یا پاسخندادن اثر میگذارد.
چهار مرحله برای آزمودن نقش اطمینان
پژوهشگران شرکت گوگل دیپمایند (Google DeepMind) یک آزمایش چهارمرحلهای طراحی کردند تا ببینند مدلهای زبانی بزرگ چگونه از اطمینان درونی خود هنگام پاسخدادن استفاده میکنند.
مرحله اول: از مدلها خواسته شد به هزار پرسش چهارگزینهای پاسخ دهند، بدون اینکه گزینه نمیدانم در اختیارشان باشد. این مرحله سطح اطمینان پایه هر مدل را مشخص کرد؛
مرحله دوم: گزینه نمیدانم به پرسشها اضافه شد تا مدل بتواند از ارائه پاسخ خودداری کند. هدف پژوهشگران این بود که بفهمند چه عواملی بیشترین نقش را در تصمیم مدل دارند.
مرحله سوم: پژوهشگران با روشی به نام هدایت فعالسازی (یعنی دستکاری مصنوعی فعالیت عصبی مدل) سطح اطمینان درونی مدل جما۳ ۲۷بی/ Gemma ۳ ۲۷B را بهطور مصنوعی بالا یا پایین بردند تا ببینند آیا این کار بر تعداد دفعات خودداری مدل اثر میگذارد یا نه.
مرحله چهارم: به مدلها دستور داده شد وقتی اطمینانشان پایینتر از آستانه مشخصی است، پاسخ ندهند. مدلها این دستور را اجرا کردند.
نویسندگان مقاله، دارشان کوماران (Dharshan Kumaran) و ناتانیل داو (Nathaniel Daw)، در نشریه نِیچِر ماشین اینتلیجنس/ Nature Machine Intelligence مینویسند: فراشناخت (یعنی توانایی اندیشیدن درباره اندیشیدن خود و سنجیدن کیفیت عملکرد ذهنی) به انسان کمک میکند رفتارش را با شرایط سازگار کند. آنها میپرسند: مدلهای زبانی نشانههایی از اطمینان خود تولید میکنند، اما آیا واقعاً از این نشانهها برای تصمیمگیری درباره پاسخدادن یا پاسخندادن استفاده میکنند؟
درون مدل چه خبر است؟
مرحله دوم نشان داد مدلهای زبانی بزرگ هنگام خودداری از ارائه پاسخ، یک آستانه درونی برای اطمینان خود اعمال میکنند و نقش این اطمینان در تصمیمگیری، تقریباً ده برابر پررنگتر از عوامل جایگزین است.
در مرحله سوم، پژوهشگران ثابت کردند اطمینان واقعاً علت خودداری از ارائه پاسخ است، نه فقط چیزی که همراه آن رخ میدهد. با افزایش سطح اطمینان، خودداری کاهش یافت و با کاهش آن، خودداری افزایش پیدا کرد. یک روش آماری نیز تأیید کرد که تغییر اطمینان، مسیر اصلی این اثر است.
کوماران، داو و همکارانشان چهار مدل زبانی بزرگ را بررسی کردند: GPT-۴o ،Gemma ۳ ۲۷B ،DeepSeek-V۳ و Qwen۳-Next-۸۰B-A۳B-Instruct. نتیجه کلی روشن بود: هرچه اطمینان درونی مدل پایینتر باشد، احتمال خودداری از پاسخدادن بیشتر است؛ یعنی برآورد مدل از میزان اطمینان خودش، واقعاً بر تصمیمهایش اثر میگذارد.
پیامدهای یافتهها برای قابلیت اطمینان هوش مصنوعی
نتایج این مطالعه نشان میدهد اگر مدلهای زبانی بزرگ بتوانند وقتی اطمینانشان از حد مشخصی پایینتر است پاسخ ندهند، این توانایی میتواند بسیار ارزشمند باشد و خطر گمراهکردن کاربران را کاهش دهد.
مدلهای زبانی دو نوع اطمینان از خود نشان میدهند:
- اطمینان کلامی یعنی آنچه مدل به زبان میگوید؛ مثلاً پایتخت استرالیا، کانبرا است؛ کاملاً مطمئنم یا فکر میکنم پایتخت استرالیا کانبرا باشد، اما زیاد مطمئن نیستم.
- اطمینان ریاضی یعنی عددی که مدل در درون خود محاسبه میکند، اما به زبان نمیآورد؛ مثلاً درون خود ۸۵ درصد احتمال میدهد که کانبرا پایتخت استرالیا است.
پژوهشگران دریافتند حتی اگر فقط به حرف مدل نگاه کنیم، باز هم میتوانیم حدس بزنیم پاسخ میدهد یا سکوت میکند: اگر بگوید کاملاً مطمئنم، احتمال خودداری از ارائه پاسخ، کم است؛ اگر بگوید حدس میزنم، این احتمال متوسط؛ و اگر بگوید مطمئن نیستم، زیاد است. اما اطمینان کلامی همیشه دقیق نیست؛ ممکن است مدل بگوید کاملاً مطمئنم اما پاسخش غلط باشد؛ به همین دلیل، اطمینان کلامی برای پیشبینی خودداری از ارائه پاسخ مفید است، اما برای تشخیص پاسخ درست از نادرست چندان مطمئن نیست.
نکته مهمتر آن است که بررسی فعالیت درونی مدل نشان داد هیچکدام از این دو معیار، تصویر کامل اطمینان مدل نیستند. تصور کنید از یک مسابقه کامل فوتبال فقط دو عکس به دستتان رسیده: یکی از دقیقه ۱۰ و یکی از دقیقه ۸۰. هر دو عکس بخشی از واقعیت را نشان میدهند، اما هیچکدام کل مسابقه را بازگو نمیکنند. اطمینان کلامی و اطمینان ریاضی نیز هر کدام فقط بخشی از اطمینان واقعی مدل را نشان میدهند؛ اطمینانی که در درون مدل بسیار غنیتر و چندلایهتر از آن است که در یک جمله یا یک عدد خلاصه شود.
گامی بهسوی عاملهای هوش مصنوعی قابلاعتمادتر
پژوهش اخیر کوماران، داو و همکارانشان میتواند راه را برای بررسیهای بیشتر باز کند تا روشن شود مدلهای زبانی بزرگ چگونه تصمیم میگیرند چه اطلاعاتی را با کاربران به اشتراک بگذارند. این مطالعات میتوانند به ساخت دستیارهای گفتوگویی هوش مصنوعی قابلاعتمادتر کمک کنند.
به نقل از ایرنا، نتیجه کلی این پژوهش آن است که خودداری از پاسخدادن، حاصل کار مشترک دو عامل است: نخست، یک تصویر درونی چندبُعدی از اطمینان یعنی مدل در درون خود، نه فقط یک عدد ساده، بلکه تصویری غنی و چندلایه از میزان اطمینانش به هر پاسخ دارد. دوم، سیاستهایی که بر اساس آستانههای مشخص تصمیم میگیرند یعنی مدل قاعدهای درونی دارد که میگوید: اگر اطمینانم از این حد کمتر شد، پاسخ نمیدهم.
این ساختار با آنچه پژوهشگران کنترل فراشناختی ساختارمند مینامند هماهنگ است؛ یعنی مدل ضمن اینکه پاسخ میدهد، میتواند کیفیت پاسخ خود را ارزیابی کند و بر اساس آن تصمیم بگیرد. چنین ظرفیتی با تبدیلشدن مدلها به عاملهای خودمختار، سامانههایی که باید بدون نظارت انسان تصمیم بگیرند، اهمیت فزایندهای پیدا میکند؛ زیرا چنین عاملهایی برای مطمئنماندن، باید عدمقطعیت خود را تشخیص دهند و در صورت لزوم، از پاسخدادن خودداری کنند.





