لوگوی شاگرد

شاگرد

آموزش بی حد و مرز، آینده بی نهایت

ورود

چرا هوش مصنوعی با اطمینان کامل جواب اشتباه می‌ده؟ OpenAI مثل یه دانش‌آموز سر امتحان توضیحش داد

چرا هوش مصنوعی با اطمینان کامل جواب اشتباه می‌ده؟ OpenAI مثل یه دانش‌آموز سر امتحان توضیحش داد
مم
6 دقیقه مطالعه

احتمالاً خودتون تجربه‌ش کردید: از یه چت‌بات یه سوال می‌پرسید، جواب رو با لحنی کاملاً مطمئن و روان دریافت می‌کنید ، بدون هیچ تردیدی، بدون «شاید» یا «فکر می‌کنم». بعد می‌فهمید کاملاً غلط بوده. این پدیده اسم مشخصی داره: «هالوسینیشن» (توهم). سوالی که کمتر کسی جوابش رو می‌دونه اینه: چرا این سیستم‌ها، به‌جای اینکه بگن «نمی‌دونم»، ترجیح می‌دن با اطمینان کامل یه چیز اشتباه بسازن؟

جواب این سوال، تو یه مقاله‌ی تحقیقاتی که خودِ OpenAI در سپتامبر ۲۰۲۵ منتشر کرد، به‌طرز شگفت‌انگیزی روشن شده و تشبیهی که خودشون استفاده کردن، دقیقاً به همون چیزی برمی‌گرده که همه‌مون تو مدرسه تجربه کردیم.

مثال واقعی: وقتی مدل سه بار دروغ می‌گه

نویسندگان این تحقیق، برای نشون دادن مشکل، یه آزمایش ساده انجام دادن: از یه چت‌بات معروف پرسیدن عنوان پایان‌نامه‌ی دکترای یکی از نویسنده‌های خودِ همین مقاله چیه. مدل با اطمینان کامل، سه عنوان متفاوت ارائه داد ، هیچ‌کدوم درست نبود. بعد پرسیدن تاریخ تولدش چیه؛ باز هم سه تاریخ متفاوت گفت، که همه‌شون اشتباه بودن.

نکته‌ی کلیدی اینجاست: مدل تو هیچ‌کدوم از این جواب‌ها تردید نشون نداد. هر بار، با همون لحن قاطع همیشگی جواب داد ، دقیقاً همون الگویی که همه‌مون باهاش آشناییم.

کشف اصلی: این یه باگ نیست، یه استراتژی بهینه‌ست

اینجا بخش جالب ماجراست. محققان OpenAI استدلال کردن که هالوسینیشن، یه نقص فنی مرموز و تصادفی نیست ، بلکه نتیجه‌ی منطقی و قابل‌پیش‌بینی نحوه‌ی آموزش و ارزیابی این مدل‌هاست. خودشون این پدیده رو با یه تشبیه توضیح دادن که برای هر کسی که امتحان تستی داده، خیلی آشناست:

«مدل‌های زبانی، درست مثل دانش‌آموزانی که سر یه سوال سخت امتحان گیر کردن، گاهی حدس می‌زنن به‌جای اینکه اعتراف کنن نمی‌دونن.»

فکرش رو بکنید: تو یه امتحان تستی که برای جواب غلط نمره‌ی منفی نداره، بهترین استراتژی چیه؟ اگه مطمئن نیستید، بازم حدس بزنید ، چون شانس درست بودنش بیشتر از صفره، در حالی که خالی گذاشتنش تضمین می‌کنه صفر می‌گیرید. این دقیقاً همون منطقیه که تو آموزش مدل‌های زبانی هم اتفاق می‌افته.

opha1

چرا این اتفاق میفته؟ نگاهی به روش امتیازدهی

تقریباً تمام معیارهای رایجی که برای سنجش کیفیت مدل‌های هوش مصنوعی استفاده می‌شن (بنچمارک‌ها)، فقط بر اساس درصد جواب‌های کاملاً درست نمره می‌دن ، نه بر اساس صداقت یا میزان اطمینان واقعی مدل. وقتی یه مدل بر اساس همین معیار آموزش داده و ارزیابی می‌شه، یاد می‌گیره که:

  • اگه جواب بده و درست باشه: امتیاز کامل

  • اگه بگه «نمی‌دونم»: امتیاز صفر (دقیقاً مثل خالی گذاشتن تست)

  • اگه حدس بزنه و اشتباه باشه: بازم امتیاز صفر ، یعنی هیچ ضرر اضافه‌ای نسبت به اعتراف به ندونستن نداره

با این ساختار امتیازدهی، حدس زدن همیشه حداقل هم‌ارزِ اعتراف به ندونستنه، و اغلب بهتر. نتیجه؟ مدل‌ها، دقیقاً مثل یه دانش‌آموز باهوش که فرمول امتحان رو فهمیده، یاد می‌گیرن همیشه یه جواب قاطع بدن ، حتی وقتی مطمئن نیستن.

یه نکته‌ی جالب‌تر: مدل‌های کوچیک‌تر گاهی صادق‌ترن

تحقیق یه یافته‌ی برخلاف‌ انتظار هم داره: مدل‌های کوچیک‌تر، گاهی راحت‌تر می‌تونن اعتراف کنن که نمی‌دونن، نسبت به مدل‌های بزرگ‌تر. مثالی که خودشون زدن: اگه از یه مدل کوچیک که هیچ‌چیزی از زبان مائوری (زبان بومی نیوزیلند) نمی‌دونه یه سوال به این زبان بپرسید، به‌راحتی می‌گه «نمی‌دونم» ، چون واقعاً هیچ اطلاعاتی نداره که باهاش حدس بزنه. اما یه مدل بزرگ‌تر که کمی زبان مائوری بلده، باید تصمیم بگیره که آیا دانش نصفه‌نیمه‌ش کافیه یا نه و این تصمیم‌گیری، دقیقاً همون‌جاییه که ریسک هالوسینیشن بالا می‌ره. به عبارت دیگه، «کالیبره بودن» (دونستن دقیق مرز دانش خود) به مراتب کار سخت‌تری از «دقیق بودن» است.

راه‌حل پیشنهادی: عوض کردن قوانین امتحان

خبر خوب اینه که محققان یه راه‌حل مشخص هم پیشنهاد دادن و جالب اینه که این راه‌حل هم دقیقاً از دنیای امتحان‌های واقعی الهام گرفته شده: همون‌طور که خیلی از امتحانات دانشگاهی برای جلوگیری از حدس زدن کورکورانه، به جواب غلط نمره‌ی منفی می‌دن، محققان پیشنهاد می‌کنن معیارهای ارزیابی هوش مصنوعی هم باید تغییر کنه ، جواب‌های غلط و مطمئن باید جریمه‌ی صریح داشته باشن، و اعتراف به عدم‌قطعیت (مثلاً «حدود ۷۰٪ مطمئنم») باید امتیاز جزئی بگیره، نه صفر مطلق.

اگه این تغییر تو معیارهای اصلی صنعت (نه فقط تو تست‌های تخصصی هالوسینیشن) اعمال بشه، مدل‌ها انگیزه پیدا می‌کنن که به‌جای حدس زدن مطمئن، عدم‌قطعیت واقعی‌شون رو نشون بدن ، دقیقاً همون چیزی که برای اعتمادپذیری هوش مصنوعی لازمه.

opha2

این یه بحث تئوریک نیست: وقتی هالوسینیشن به دادگاه کشیده شد

شاید مشهورترین نمونه‌ی واقعی این مشکل، پرونده‌ی یه وکیل آمریکایی در سال ۲۰۲۳ باشه. این وکیل، برای تهیه‌ی یه لایحه‌ی حقوقی، از ChatGPT کمک گرفت تا پرونده‌های قضایی مشابه رو پیدا کنه. مدل با اطمینان کامل، شش پرونده‌ی قضایی کاملاً ساختگی ، با نام قاضی، شماره‌ی پرونده، و نقل‌قول‌های دقیق ، تحویلش داد. وکیل، بدون بررسی، همه‌شون رو مستقیم تو لایحه‌ی رسمی دادگاه استفاده کرد.

وقتی طرف مقابل نتونست هیچ‌کدوم از این پرونده‌ها رو تو پایگاه‌های داده‌ی قضایی پیدا کنه، قاضی از خود وکیل خواست توضیح بده. نتیجه؟ جریمه‌ی نقدی برای وکیل و شریک حقوقی‌اش، و یه رسوایی رسانه‌ای گسترده که تبدیل به یکی از پراستنادترین مثال‌های خطر هالوسینیشن تو دنیای حرفه‌ای شد. این پرونده دقیقاً نشون می‌ده چرا این «باگ آماری» که محققان توضیح دادن، وقتی به دنیای واقعی می‌رسه، می‌تونه عواقب جدی داشته باشه.

opja3

چطور خودمون ریسک رو کم کنیم؟

با دونستن این‌که هالوسینیشن یه ویژگی ساختاری این سیستم‌هاست (نه یه اشکال موقت که به‌زودی کامل برطرف می‌شه)، چند تا عادت ساده می‌تونه ریسک رو به‌طرز چشمگیری کم کنه:

  • از مدل بخواید منبع دقیق بده، نه فقط جواب. اگه یه مدل نتونه به یه منبع قابل‌بررسی اشاره کنه (یا منبعی که میده مشکوک به‌نظر برسه)، این خودش یه پرچم قرمزه.

  • هر ادعای مهم و قابل‌استناد رو (اسم، تاریخ، آمار، منبع علمی) جداگانه بررسی کنید، مخصوصاً وقتی قراره تو یه سند رسمی، مقاله، یا تصمیم مهم استفاده بشه ، دقیقاً همون کاری که اون وکیل انجام نداد.

  • به لحن قاطع اعتماد نکنید. همون‌طور که تو این مقاله دیدیم، اطمینان لحن مدل، هیچ ربطی به درستی واقعی جوابش نداره . این دو تا کاملاً مستقل از همدیگه‌ان.

  • برای سوالات خیلی تخصصی یا کم‌شناخته‌شده، احتمال هالوسینیشن بیشتره ، چون دقیقاً همون‌جاهاییه که مدل «دانش نصفه‌نیمه» داره و باید بین حدس زدن و اعتراف به ندونستن تصمیم بگیره.

پس یعنی این مشکل حل‌شدنیه؟

طبق این تحقیق، بله ، اما نه با یه اصلاح فنی ساده تو خود مدل، بلکه با تغییر فرهنگ ارزیابی تو کل صنعت هوش مصنوعی. تا وقتی جدول رتبه‌بندی‌ها (Leaderboard) و معیارهای اصلی، صرفاً بر اساس «درصد جواب درست» مدل‌ها رو مقایسه کنن، مدل‌ها هم منطقی‌ترین کارشون رو می‌کنن: حدس زدن با اطمینان کامل، به‌جای اعتراف صادقانه به ندونستن.

حرف آخر

دفعه‌ی بعد که یه چت‌بات با لحن کاملاً مطمئن یه چیز اشتباه بهتون گفت، یادتون باشه: این رفتار، یه نقص عجیب و غریب نیست ، دقیقاً همون رفتاری‌یه که ازش خواسته شده. مدل داره، مثل یه دانش‌آموز باهوش سر یه امتحان تستی بدون نمره‌ی منفی، بهینه‌ترین استراتژی ممکن رو اجرا می‌کنه. تا وقتی «امتحان» عوض نشه، این رفتار هم عوض نمی‌شه.