“`html
به نقل از دیجیتال مارکتینگ ایران، پژوهشی جدید نشان میدهد برخی مدلهای هوش مصنوعی چندوجهی ممکن است هنگام مشاهده چهره افراد، ویژگیهای ظاهری کاملاً نامرتبط را به صفاتی مانند شایستگی و قابلاعتماد بودن ارتباط دهند. نکته نگرانکنندهتر این است که این الگو در برخی آزمایشها به تصمیمهای حساستری مانند استخدام، سرمایهگذاری یا حتی قضاوت درباره احتمال ارتکاب جرایم نیز گسترش پیدا کرده است.
این مطالعه که در PNAS Nexus منتشر شده، رفتار چهار مدل زبانی را در مجموعهای از آزمایشها بررسی کرده است. پژوهشگران در مجموع ۱۳ آزمایش و نزدیک به ۸ هزار آزمون انجام دادند تا مشخص کنند آیا مدلهای هوش مصنوعی، مانند انسانها، از ویژگیهای چهره برای استنباط ویژگیهای شخصیتی استفاده میکنند یا خیر.
نتایج نشان میدهد مسئله فقط یک پاسخ تصادفی یا موردی نیست. در آزمایشها، مدلها بارها چهرههایی را که انسانها نیز معمولاً شایستهتر یا قابلاعتمادتر ارزیابی میکنند، ترجیح دادند؛ حتی در شرایطی که ویژگیهای ظاهری مورد استفاده هیچ ارتباط واقعی و قابل اثباتی با توانایی، شخصیت یا رفتار فرد ندارند.
سوگیری چهرهای چیست؟
انسانها معمولاً در برخورد با چهره افراد، خیلی سریع درباره ویژگیهایی مانند اعتمادپذیری، شایستگی یا مهربانی قضاوت میکنند. این پدیده در روانشناسی با مفهوم Face-to-Character Inference یا استنباط شخصیت از چهره شناخته میشود.
مشکل اینجاست که شکل و بافت چهره اطلاعات قابل اتکایی درباره بسیاری از ویژگیهای واقعی شخصیت فرد ارائه نمیکند. با وجود این، مغز انسان بهصورت طبیعی تمایل دارد از نشانههای ظاهری برای رسیدن به چنین نتیجهگیریهایی استفاده کند.
پژوهشهای روانشناسی حتی نشان دادهاند که این الگو از سنین بسیار پایین ظاهر میشود. به همین دلیل، پژوهشگران مطالعه جدید میخواستند بدانند آیا مدلهایی که با حجم عظیمی از دادههای انسانی آموزش دیدهاند، این نوع خطای شناختی را نیز یاد گرفتهاند یا خیر.
آیا مدلهای زبانی این سوگیری انسانی را یاد گرفتهاند؟
یکی از پرسشهای اصلی پژوهش این بود که آیا مدلهای چندوجهی مانند GPT-4o میتوانند از تصویر چهره، ویژگیهایی درباره شخصیت فرد استنباط کنند؛ حتی زمانی که هیچ داده واقعی درباره شخصیت آن فرد در اختیار ندارند.
پژوهشگران استدلال کردند که مدلهای هوش مصنوعی با حجم بسیار زیادی از محتوای تولیدشده توسط انسان آموزش میبینند و این دادهها خودشان حاوی انواع سوگیریهای انسانی هستند. بنابراین ممکن است مدلها ارتباطهایی را یاد بگیرند که در واقعیت معتبر نیستند، اما در دادههای انسانی بارها تکرار شدهاند.
به گفته پژوهشگران، این مسئله از آن جهت اهمیت دارد که مدلهای هوش مصنوعی بهطور فزایندهای در تصمیمگیری و تحلیل دادههای انسانی مورد استفاده قرار میگیرند. اگر یک مدل بتواند از یک ویژگی ظاهری نامرتبط به یک نتیجه شخصیتی برسد، استفاده از آن در موقعیتهای حساس میتواند پیامدهای جدی داشته باشد.
GPT-4o در آزمایش شایستگی چه عملکردی داشت؟
در نخستین آزمایشها، پژوهشگران مجموعهای از چهرههای مصنوعی تولیدشده توسط رایانه را در اختیار GPT-4o قرار دادند. چهرهها بهگونهای دستکاری شده بودند که در برخی ویژگیهای فیزیکی مرتبط با برداشت انسانی از شایستگی یا قابلاعتماد بودن با یکدیگر تفاوت داشته باشند.
در ۶۰۰ آزمون مربوط به شایستگی، مدل باید از میان دو چهره مشخص میکرد کدام فرد شایستهتر به نظر میرسد. GPT-4o در ۸۷.۸۳ درصد موارد چهرهای را انتخاب کرد که انسانها نیز معمولاً آن را شایستهتر ارزیابی میکنند.
در ۶۰۰ آزمون دیگر درباره قابلاعتماد بودن، مدل در ۷۲.۶۷ درصد موارد چهرهای را انتخاب کرد که از دید ارزیابیهای انسانی قابلاعتمادتر به نظر میرسید.
این نتایج به این معنا نیست که چهره واقعاً اطلاعاتی درباره شایستگی یا صداقت افراد در اختیار مدل قرار داده است. مسئله دقیقاً برعکس است: چهرهها با ویژگیهای ظاهری تغییر کرده بودند و مدل از همین تفاوتهای ظاهری برای رسیدن به نتیجه استفاده کرده است.
هرچه تفاوت چهرهها بیشتر بود، سوگیری شدیدتر شد
پژوهشگران میزان تفاوت فیزیکی میان چهرهها را نیز تغییر دادند. زمانی که دو چهره از نظر ویژگیهای مرتبط با شایستگی تفاوت زیادی داشتند، سوگیری مدل بیشتر شد.
برای چهرههایی که فاصله آنها در ویژگیهای مورد بررسی به شش انحراف معیار میرسید، GPT-4o در ۹۸ درصد موارد چهره مورد انتظار را انتخاب کرد. در مقابل، وقتی تفاوت به دو انحراف معیار کاهش پیدا کرد و چهرهها شباهت بیشتری داشتند، میزان انتخاب به حدود ۷۰ درصد رسید.
این الگو نشان میدهد شدت تفاوتهای بصری میتواند بر میزان اتکای مدل به چنین نشانههایی اثر بگذارد.
آیا مدل هوش مصنوعی حتی از انسانها هم سوگیری بیشتری نشان داد؟
یکی از یافتههای مهم مطالعه، مقایسه رفتار مدل با برآورد رفتار انسانها بود. بر اساس مدلسازی ریاضی پژوهشگران، انتظار میرفت انسانها در همان وظیفه شناسایی چهره شایستهتر، حدود ۶۲.۶۵ درصد مواقع چهره مورد انتظار را انتخاب کنند.
این رقم در مورد GPT-4o به ۸۷.۸۳ درصد رسید. بنابراین در این آزمایش مشخص، مدل بسیار منظمتر از برآورد رفتار انسانی همان الگوی سوگیرانه را تکرار کرد.
با این حال، پژوهشگران تأکید میکنند که این تفاوت لزوماً به معنای «سوگیری ذاتی بیشتر» در مدل نیست. بخشی از اثر میتواند به این دلیل باشد که پاسخهای مدل نسبت به انسانها واریانس کمتری داشتهاند و مدل در انتخاب خود بسیار منسجمتر عمل کرده است. با این وجود، همین ثبات بالا در کاربردهایی مانند استخدام میتواند اهمیت ویژهای داشته باشد، زیرا یک سوگیری ثابت و قابل تکرار میتواند به تصمیمهای منظم اما ناعادلانه منجر شود.
سوگیری مدل به صفات شخصیتی دیگر هم تعمیم پیدا کرد
پژوهشگران بررسی خود را به صفات دیگری نیز گسترش دادند. در مجموع ۲۱۶۰ آزمون، GPT-4o همان چهرهها را از نظر ویژگیهایی مانند باهوش یا تنبل بودن، در ارتباط با شایستگی، و گرم یا خودخواه بودن، در ارتباط با قابلاعتماد بودن ارزیابی کرد.
مدل در ۷۴.۶۳ درصد آزمونهای مربوط به ویژگیهای شایستگی و ۷۳.۳۳ درصد آزمونهای مربوط به ویژگیهای اعتمادپذیری، چهره مورد انتظار را انتخاب کرد.
به عبارت دیگر، مدل فقط به یک سؤال محدود پاسخ نداد؛ بلکه ارتباطی که میان برخی ویژگیهای چهره و یک برداشت کلی از شخصیت ایجاد کرده بود، به صفات مرتبط دیگر نیز تعمیم داد.
حتی چهره میمونها نیز از این الگو تأثیر گرفت
در یکی از آزمایشهای جالب، پژوهشگران ۱۵۰ جفت تصویر از چهرههای میمونهای ماکاک را در اختیار GPT-4o قرار دادند. این تصاویر قبلاً توسط انسانها بر اساس اینکه حیوان «خوب» یا «خشن» به نظر میرسد ارزیابی شده بودند.
GPT-4o در ۶۶ درصد موارد، میمونی را که انسانها «خوشایندتر» ارزیابی کرده بودند، قابلاعتمادتر دانست.
این آزمایش از این جهت اهمیت دارد که نشان میدهد الگوی موردنظر لزوماً به شناخت چهرههای انسانی یا حفظ کردن نمونههای موجود در دادههای آموزشی محدود نیست. مدل ظاهراً میتواند یک مفهوم عمومیتر درباره ارتباط میان ظاهر چهره و اعتمادپذیری ایجاد کند و آن را در مورد تصاویر غیرانسانی نیز به کار ببرد.
وقتی سوگیری چهرهای وارد تصمیمهای پرریسک میشود
بخش حساستر پژوهش زمانی آغاز شد که پژوهشگران بررسی کردند آیا مدل از همین قضاوتهای ظاهری برای تصمیمهای بسیار جدیتر نیز استفاده میکند یا خیر.
در یک آزمایش شامل ۵۴۰ آزمون، از GPT-4o خواسته شد از میان دو چهره مشخص کند کدام فرد احتمال بیشتری دارد که مرتکب رفتارهایی مانند قتل زنجیرهای، قاچاق انسان یا کلاهبرداری مالی شود.
مدل در ۶۸.۷۰ درصد موارد، چهرهای را انتخاب کرد که در ارزیابیهای مربوط به اعتمادپذیری، ظاهر نامطلوبتری داشت.
در یک آزمایش دیگر نیز از مدل درباره تصمیمهای مثبت و واقعیتر سؤال شد؛ برای مثال اینکه کدام فرد برای ریاست یک دانشگاه مناسبتر است یا کدام فرد باید برای راهاندازی یک شرکت فناوری سرمایه دریافت کند. در این آزمونها، GPT-4o در ۷۵.۱۹ درصد موارد فردی را انتخاب کرد که چهرهاش از نظر ظاهری شایستهتر ارزیابی میشد.
این نتایج نشان میدهد همان الگویی که در یک مقایسه ساده چهرهای دیده شد، میتواند در سناریوهایی با پیامدهای اجتماعی و اقتصادی بسیار بزرگتر نیز ظاهر شود.
مدلهای جدیدتر هم این مشکل را نشان دادند
پژوهشگران برای بررسی اینکه این مسئله فقط به GPT-4o محدود است یا خیر، آزمایشهای اصلی را با سه مدل دیگر تکرار کردند: GPT-5، Gemini 3 Flash Preview و Claude Sonnet 4.5.
هر سه مدل نیز سوگیری قابل توجهی در قضاوت شخصیت بر اساس چهره نشان دادند. در برخی آزمایشها حتی شدت این الگو نسبت به مدل قدیمیتر بیشتر بود.
برای مثال، GPT-5 در ارزیابیهای پایه شایستگی، چهره مورد انتظار را در ۹۴.۳۳ درصد موارد انتخاب کرد. این میزان در تصمیمهای شبیهسازیشده دنیای واقعی به ۹۷.۰۴ درصد رسید.
پژوهشگران همچنین انتظار داشتند مدلهای جدیدتر که قابلیتهای استدلالی پیشرفتهتری دارند، ممکن است هنگام مواجهه با چنین سؤالاتی بیشتر درباره اعتبار معیار تصمیمگیری فکر کنند و از قضاوت ظاهری فاصله بگیرند. نتایج آزمایش چنین چیزی را نشان نداد و مدلهای جدید نیز همچنان الگوی موردنظر را نشان دادند.
آیا این نتایج به معنای «یادگیری تبعیض از تصاویر» است؟
پاسخ هنوز قطعی نیست. یکی از پرسشهای مهم پژوهشگران این است که مدلهای زبانی چگونه به چنین ارتباطهایی دست پیدا میکنند؛ بهخصوص اینکه سوگیری مورد بررسی بیشتر به ادراک بصری مربوط است تا زبان.
یک توضیح احتمالی این است که دادههای آموزشی مدلها حاوی ارتباطهای ضمنی میان ظاهر افراد و ویژگیهای شخصیتی هستند. مدل میتواند چنین الگوهایی را از متنها و توصیفهای انسانی یاد بگیرد و هنگام تحلیل تصویر از آنها استفاده کند.
با این حال، پژوهشگران معتقدند توضیح «مدل فقط دادههای آموزشی را بازتاب میدهد» بهتنهایی کافی نیست، زیرا در برخی آزمایشها میزان سوگیری از برآورد رفتار انسانی بیشتر بوده و در مدلهای جدید نیز افزایش نشان داده است.
البته این مطالعه بهتنهایی نمیتواند منشأ دقیق این سوگیری را مشخص کند. برای پاسخ به این پرسش، آزمایشهای بیشتری درباره دادههای آموزشی، فرایند آموزش چندوجهی و نحوه شکلگیری ارتباط میان تصویر و مفاهیم انتزاعی مورد نیاز است.
چرا استفاده از AI در استخدام و امور حقوقی حساس است؟
اگر یک مدل هوش مصنوعی در انتخاب کارمند، ارزیابی متقاضی، اعطای وام، تصمیمهای حقوقی یا سایر فرایندهای پرریسک به ویژگیهای نامرتبط ظاهری تکیه کند، نتیجه میتواند برای افراد پیامدهای واقعی داشته باشد.
مسئله مهم این است که چنین سوگیریای ممکن است بهسادگی قابل مشاهده نباشد. یک سیستم ممکن است در ظاهر از معیارهای مشخص و بیطرفانه استفاده کند، اما در پسزمینه، تصویر فرد را نیز در تصمیم خود دخالت دهد.
این موضوع با سوگیریهای آشکارتری مانند تبعیض جنسیتی یا نژادی تفاوت دارد. برای این دسته از مسائل معمولاً آزمونها و محافظهای ایمنی مشخصتری در نظر گرفته میشود، اما سوگیری ناشی از فرم چهره یا سایر ویژگیهای ظاهری ظریف ممکن است کمتر مورد بررسی قرار گرفته باشد.
محدودیتهای مهم این پژوهش
با وجود اهمیت نتایج، یافتههای مطالعه باید در چارچوب روش آزمایش تفسیر شوند. بسیاری از آزمونها به شکل Forced Choice طراحی شده بودند؛ یعنی مدل مجبور بود یکی از دو چهره را انتخاب کند.
در کاربردهای واقعی، یک مدل ممکن است در شرایطی قرار گیرد که مجبور نباشد بین دو فرد انتخاب کند و بتواند عدم قطعیت خود را بیان کند یا از ارائه قضاوت درباره شخصیت افراد بر اساس چهره خودداری کند. بنابراین رفتار مدل در محیط واقعی لزوماً دقیقاً مشابه این آزمایشها نخواهد بود.
همچنین پژوهشگران از تصاویر ثابت دوبعدی استفاده کردند. هنوز مشخص نیست مدلها در مواجهه با ویدئو، زوایای مختلف چهره، شرایط نوری متفاوت یا تصاویر واقعی و غیرکنترلشده چه رفتاری نشان میدهند.
همچنین نتایج فعلی عمدتاً روی مفاهیم شایستگی و اعتمادپذیری تمرکز دارند و برای نتیجهگیری درباره همه انواع سوگیریهای بصری، به پژوهشهای بیشتری نیاز است.
آیا توسعه مدلهای هوش مصنوعی بدون آزمون سوگیری کافی است؟
یکی از پیامهای اصلی این مطالعه این است که عبور مدل از آزمونهای رایج سوگیری، الزاماً به معنای بیطرف بودن آن در تمام موقعیتها نیست. ممکن است یک مدل در برابر تبعیضهای آشکار عملکرد مناسبی داشته باشد، اما در زمینهای کمتر بررسیشده همچنان از الگوهای انسانی و نادرست استفاده کند.
به همین دلیل، ارزیابی مدلهای چندوجهی باید فراتر از بررسی متن و پاسخهای زبانی باشد. زمانی که یک سیستم میتواند تصویر را ببیند و درباره انسانها تصمیم بگیرد، لازم است آزمونهای ویژهای برای کشف سوگیریهای بصری نیز طراحی شود.
برای سازمانهایی که قصد دارند از AI در فرایندهای استخدام، ارزیابی یا تصمیمگیری حساس استفاده کنند، این مسئله اهمیت بیشتری دارد. بررسی عملکرد مدل روی دادههای واقعی، اجرای آزمونهای سوگیری پیش از استقرار و حفظ نظارت انسانی میتواند بخشی از فرایند ارزیابی ریسک چنین سیستمهایی باشد.
جمعبندی
پژوهش منتشرشده در PNAS Nexus نشان میدهد مدلهای چندوجهی میتوانند از ویژگیهای ظاهری چهره برای قضاوت درباره ویژگیهایی مانند شایستگی و اعتمادپذیری استفاده کنند؛ حتی زمانی که هیچ دلیل واقعی برای ارتباط میان ظاهر و این ویژگیها وجود ندارد.
در آزمایشها، GPT-4o این الگو را با نرخ بالایی نشان داد و مدلهای جدیدتری مانند GPT-5، Gemini 3 Flash Preview و Claude Sonnet 4.5 نیز رفتار مشابهی داشتند. نکته مهمتر این است که سوگیری موردنظر در برخی سناریوها به تصمیمهای حساس مربوط به استخدام، سرمایهگذاری و قضاوت درباره رفتارهای مجرمانه نیز تعمیم پیدا کرد.
این یافتهها به معنای آن نیست که مدلهای هوش مصنوعی همیشه چنین قضاوتهایی خواهند داشت یا میتوان رفتار آنها در محیطهای واقعی را صرفاً بر اساس این آزمایش پیشبینی کرد. با این حال، نتایج نشان میدهد ارزیابی ایمنی و بیطرفی مدلهای چندوجهی باید سوگیریهای ظریف و بصری را نیز در بر بگیرد.
با گسترش استفاده از هوش مصنوعی در تصمیمهای انسانی، سؤال مهم فقط این نیست که یک مدل چقدر دقیق پاسخ میدهد؛ بلکه باید بررسی شود بر اساس چه نشانههایی به پاسخ خود رسیده است و آیا آن نشانهها واقعاً ارتباطی با تصمیم موردنظر دارند یا خیر.
برای مطالعه جدیدترین اخبار و تحلیلهای هوش مصنوعی، تحقیقات علمی و اخلاق فناوری به دیجیتال مارکتینگ ایران مراجعه کنید.
“`






