احتمالاً خودتون تجربهش کردید: از یه چتبات یه سوال میپرسید، جواب رو با لحنی کاملاً مطمئن و روان دریافت میکنید ، بدون هیچ تردیدی، بدون «شاید» یا «فکر میکنم». بعد میفهمید کاملاً غلط بوده. این پدیده اسم مشخصی داره: «هالوسینیشن» (توهم). سوالی که کمتر کسی جوابش رو میدونه اینه: چرا این سیستمها، بهجای اینکه بگن «نمیدونم»، ترجیح میدن با اطمینان کامل یه چیز اشتباه بسازن؟
جواب این سوال، تو یه مقالهی تحقیقاتی که خودِ OpenAI در سپتامبر ۲۰۲۵ منتشر کرد، بهطرز شگفتانگیزی روشن شده و تشبیهی که خودشون استفاده کردن، دقیقاً به همون چیزی برمیگرده که همهمون تو مدرسه تجربه کردیم.
مثال واقعی: وقتی مدل سه بار دروغ میگه
نویسندگان این تحقیق، برای نشون دادن مشکل، یه آزمایش ساده انجام دادن: از یه چتبات معروف پرسیدن عنوان پایاننامهی دکترای یکی از نویسندههای خودِ همین مقاله چیه. مدل با اطمینان کامل، سه عنوان متفاوت ارائه داد ، هیچکدوم درست نبود. بعد پرسیدن تاریخ تولدش چیه؛ باز هم سه تاریخ متفاوت گفت، که همهشون اشتباه بودن.
نکتهی کلیدی اینجاست: مدل تو هیچکدوم از این جوابها تردید نشون نداد. هر بار، با همون لحن قاطع همیشگی جواب داد ، دقیقاً همون الگویی که همهمون باهاش آشناییم.
کشف اصلی: این یه باگ نیست، یه استراتژی بهینهست
اینجا بخش جالب ماجراست. محققان OpenAI استدلال کردن که هالوسینیشن، یه نقص فنی مرموز و تصادفی نیست ، بلکه نتیجهی منطقی و قابلپیشبینی نحوهی آموزش و ارزیابی این مدلهاست. خودشون این پدیده رو با یه تشبیه توضیح دادن که برای هر کسی که امتحان تستی داده، خیلی آشناست:
«مدلهای زبانی، درست مثل دانشآموزانی که سر یه سوال سخت امتحان گیر کردن، گاهی حدس میزنن بهجای اینکه اعتراف کنن نمیدونن.»
فکرش رو بکنید: تو یه امتحان تستی که برای جواب غلط نمرهی منفی نداره، بهترین استراتژی چیه؟ اگه مطمئن نیستید، بازم حدس بزنید ، چون شانس درست بودنش بیشتر از صفره، در حالی که خالی گذاشتنش تضمین میکنه صفر میگیرید. این دقیقاً همون منطقیه که تو آموزش مدلهای زبانی هم اتفاق میافته.

چرا این اتفاق میفته؟ نگاهی به روش امتیازدهی
تقریباً تمام معیارهای رایجی که برای سنجش کیفیت مدلهای هوش مصنوعی استفاده میشن (بنچمارکها)، فقط بر اساس درصد جوابهای کاملاً درست نمره میدن ، نه بر اساس صداقت یا میزان اطمینان واقعی مدل. وقتی یه مدل بر اساس همین معیار آموزش داده و ارزیابی میشه، یاد میگیره که:
اگه جواب بده و درست باشه: امتیاز کامل
اگه بگه «نمیدونم»: امتیاز صفر (دقیقاً مثل خالی گذاشتن تست)
اگه حدس بزنه و اشتباه باشه: بازم امتیاز صفر ، یعنی هیچ ضرر اضافهای نسبت به اعتراف به ندونستن نداره
با این ساختار امتیازدهی، حدس زدن همیشه حداقل همارزِ اعتراف به ندونستنه، و اغلب بهتر. نتیجه؟ مدلها، دقیقاً مثل یه دانشآموز باهوش که فرمول امتحان رو فهمیده، یاد میگیرن همیشه یه جواب قاطع بدن ، حتی وقتی مطمئن نیستن.
یه نکتهی جالبتر: مدلهای کوچیکتر گاهی صادقترن
تحقیق یه یافتهی برخلاف انتظار هم داره: مدلهای کوچیکتر، گاهی راحتتر میتونن اعتراف کنن که نمیدونن، نسبت به مدلهای بزرگتر. مثالی که خودشون زدن: اگه از یه مدل کوچیک که هیچچیزی از زبان مائوری (زبان بومی نیوزیلند) نمیدونه یه سوال به این زبان بپرسید، بهراحتی میگه «نمیدونم» ، چون واقعاً هیچ اطلاعاتی نداره که باهاش حدس بزنه. اما یه مدل بزرگتر که کمی زبان مائوری بلده، باید تصمیم بگیره که آیا دانش نصفهنیمهش کافیه یا نه و این تصمیمگیری، دقیقاً همونجاییه که ریسک هالوسینیشن بالا میره. به عبارت دیگه، «کالیبره بودن» (دونستن دقیق مرز دانش خود) به مراتب کار سختتری از «دقیق بودن» است.
راهحل پیشنهادی: عوض کردن قوانین امتحان
خبر خوب اینه که محققان یه راهحل مشخص هم پیشنهاد دادن و جالب اینه که این راهحل هم دقیقاً از دنیای امتحانهای واقعی الهام گرفته شده: همونطور که خیلی از امتحانات دانشگاهی برای جلوگیری از حدس زدن کورکورانه، به جواب غلط نمرهی منفی میدن، محققان پیشنهاد میکنن معیارهای ارزیابی هوش مصنوعی هم باید تغییر کنه ، جوابهای غلط و مطمئن باید جریمهی صریح داشته باشن، و اعتراف به عدمقطعیت (مثلاً «حدود ۷۰٪ مطمئنم») باید امتیاز جزئی بگیره، نه صفر مطلق.
اگه این تغییر تو معیارهای اصلی صنعت (نه فقط تو تستهای تخصصی هالوسینیشن) اعمال بشه، مدلها انگیزه پیدا میکنن که بهجای حدس زدن مطمئن، عدمقطعیت واقعیشون رو نشون بدن ، دقیقاً همون چیزی که برای اعتمادپذیری هوش مصنوعی لازمه.

این یه بحث تئوریک نیست: وقتی هالوسینیشن به دادگاه کشیده شد
شاید مشهورترین نمونهی واقعی این مشکل، پروندهی یه وکیل آمریکایی در سال ۲۰۲۳ باشه. این وکیل، برای تهیهی یه لایحهی حقوقی، از ChatGPT کمک گرفت تا پروندههای قضایی مشابه رو پیدا کنه. مدل با اطمینان کامل، شش پروندهی قضایی کاملاً ساختگی ، با نام قاضی، شمارهی پرونده، و نقلقولهای دقیق ، تحویلش داد. وکیل، بدون بررسی، همهشون رو مستقیم تو لایحهی رسمی دادگاه استفاده کرد.
وقتی طرف مقابل نتونست هیچکدوم از این پروندهها رو تو پایگاههای دادهی قضایی پیدا کنه، قاضی از خود وکیل خواست توضیح بده. نتیجه؟ جریمهی نقدی برای وکیل و شریک حقوقیاش، و یه رسوایی رسانهای گسترده که تبدیل به یکی از پراستنادترین مثالهای خطر هالوسینیشن تو دنیای حرفهای شد. این پرونده دقیقاً نشون میده چرا این «باگ آماری» که محققان توضیح دادن، وقتی به دنیای واقعی میرسه، میتونه عواقب جدی داشته باشه.

چطور خودمون ریسک رو کم کنیم؟
با دونستن اینکه هالوسینیشن یه ویژگی ساختاری این سیستمهاست (نه یه اشکال موقت که بهزودی کامل برطرف میشه)، چند تا عادت ساده میتونه ریسک رو بهطرز چشمگیری کم کنه:
از مدل بخواید منبع دقیق بده، نه فقط جواب. اگه یه مدل نتونه به یه منبع قابلبررسی اشاره کنه (یا منبعی که میده مشکوک بهنظر برسه)، این خودش یه پرچم قرمزه.
هر ادعای مهم و قابلاستناد رو (اسم، تاریخ، آمار، منبع علمی) جداگانه بررسی کنید، مخصوصاً وقتی قراره تو یه سند رسمی، مقاله، یا تصمیم مهم استفاده بشه ، دقیقاً همون کاری که اون وکیل انجام نداد.
به لحن قاطع اعتماد نکنید. همونطور که تو این مقاله دیدیم، اطمینان لحن مدل، هیچ ربطی به درستی واقعی جوابش نداره . این دو تا کاملاً مستقل از همدیگهان.
برای سوالات خیلی تخصصی یا کمشناختهشده، احتمال هالوسینیشن بیشتره ، چون دقیقاً همونجاهاییه که مدل «دانش نصفهنیمه» داره و باید بین حدس زدن و اعتراف به ندونستن تصمیم بگیره.
پس یعنی این مشکل حلشدنیه؟
طبق این تحقیق، بله ، اما نه با یه اصلاح فنی ساده تو خود مدل، بلکه با تغییر فرهنگ ارزیابی تو کل صنعت هوش مصنوعی. تا وقتی جدول رتبهبندیها (Leaderboard) و معیارهای اصلی، صرفاً بر اساس «درصد جواب درست» مدلها رو مقایسه کنن، مدلها هم منطقیترین کارشون رو میکنن: حدس زدن با اطمینان کامل، بهجای اعتراف صادقانه به ندونستن.
حرف آخر
دفعهی بعد که یه چتبات با لحن کاملاً مطمئن یه چیز اشتباه بهتون گفت، یادتون باشه: این رفتار، یه نقص عجیب و غریب نیست ، دقیقاً همون رفتارییه که ازش خواسته شده. مدل داره، مثل یه دانشآموز باهوش سر یه امتحان تستی بدون نمرهی منفی، بهینهترین استراتژی ممکن رو اجرا میکنه. تا وقتی «امتحان» عوض نشه، این رفتار هم عوض نمیشه.

