علمی-فرهنگی

هوش مصنوعی افراد را بر اساس چهره‌شان قضاوت می‌کند

نتایج یک مطالعه جدید نشان می دهد که هوش مصنوعی نیز مانند انسان‌ها، کتاب را از روی جلد آن داوری می‌کند. بر این اساس مشخص شد مدل‌های هوش مصنوعی از جمله جی‌پی‌تی-۴ او (GPT-4o)، جی‌پی‌تی-۵ (GPT-5)، جمینای (Gemini) و کلود (Claude) افراد را از روی چهره‌شان به همان شیوه‌ی سوگیرانه انسان‌ها قضاوت می‌کنند و برخی چهره‌ها را بدون هیچ دلیل واقعی، شایسته‌تر یا قابل‌اعتمادتر می‌دانند.

به گزارش سیناپرس، تیمی از محققان دانشگاه‌های هاروارد (Harvard)، کارنگی ملون (Carnegie Mellon) و شرکت کنگرید اینک (Cangrade, Inc.) در مطالعات جدید خود دریافتند هوش مصنوعی نیز مانند انسان ها سایر افراد را از روی ظاهر قضاوت کرده و در نزدیک به هشت‌هزار آزمایش، مدل جی‌پی‌تی-۴ او این سوگیری را به حدس زدن درباره‌ی احتمال مجرم بودن افراد و نیز تصمیم‌گیری درباره‌ی استخدام یا تأمین مالی آن‌ها نیز تعمیم داد و همه‌ این قضاوت‌ها صرفاً بر اساس یک عکس انجام شد.

گفتنی است مدل‌های جدیدتر مانند جی‌پی‌تی-۵ و جمینای این سوگیری را حتی شدیدتر از جی‌پی‌تی-۴او نشان دادند و سوگیری مدل کلود نیز در تصمیم‌های واقعی به شدت افزایش یافت. پژوهشگران تأکید می‌کنند که آموزش‌های ایمنی هوش مصنوعی، سوگیری‌های آشکار مانند نژاد و جنسیت را مسدود می‌کند اما این نوع سوگیری را به‌طور کامل نادیده گرفته است؛ زیرا توسعه‌دهندگان نمی‌توانند همه‌ی راه‌های ممکن ناعادلانه بودن هوش مصنوعی را غربال کنند.

این مساله دارای اهمیت بسیار زیادی است. فرض کنید یک نامزد شغلی نه به دلیل رزومه، بلکه به دلیل شکل چهره‌اش رد شود. این سناریو که مدت‌هاست به‌عنوان ضعف واقعی انسان‌ها مستند شده، اکنون ممکن است در سامانه‌های هوش مصنوعی که به‌طور فزاینده برای اتخاذ تصمیم‌های مهم به کار می‌روند، نهادینه شده باشد. مطالعه‌ای جدید نشان می‌دهد که مدل‌های زبانی بزرگ مانند جی‌پی‌تی-۴او، جی‌پی‌تی-۵، جمینای و کلود، بر اساس ظاهر چهره، درباره‌ی شخصیت افراد قضاوت می‌کنند و همان سوگیری شناخته‌شده‌ی انسانی را که هیچ پایه‌ی واقعی ندارد، بازتولید می‌کند.

این سامانه‌ها برای چنین کاری طراحی نشده بودند. مدل‌هایی مانند جی‌پی‌تی-۴او عمدتاً بر اساس متن آموزش دیده‌اند نه تصویر، و برای پرهیز از قضاوت‌های زیان‌بار و ناعادلانه تنظیم شده‌اند. با این حال، در نزدیک به هشت‌هزار آزمایش در سیزده مطالعه، همه‌ی مدل‌های مورد بررسی همین سوگیری را نشان دادند و چهره‌ها را صرفاً بر اساس ساختار صورت، شایسته‌تر ارزیابی کردند. مدل جی‌پی‌تی-۴او الگوی مشابهی را برای قابل‌اعتماد بودن نیز نشان داد و فراتر رفت و از ظاهر چهره برای حدس زدن احتمال ارتکاب جرایمی مانند قتل یا قاچاق انسان استفاده کرد.

اصلی ترین پرسش مطرح شده در مطالعات فوق این بود که آیا سامانه‌های هوش مصنوعی خطای شناخته‌شده‌ی انسانی را تکرار می‌کنند یا از آن فراتر می‌روند؟ متاسفانه پاسخ به دست امده  بسیار جدی و نگران‌کننده است.

در ادامه، پژوهشگران به‌جای استفاده از عکس‌های واقعی، از چهره‌های تولیدشده توسط رایانه بهره بردند که ویژگی‌های خاصی داشتند که از پیش مشخص بود بر داوری انسان‌ها تأثیر می‌گذارند. در دو آزمایش نخست، مدل جی‌پی‌تی-۴او در حدود ۸۸ درصد موارد، همان چهره‌ای را که انسان‌ها معمولاً شایسته‌تر می‌دانند انتخاب کرد و در حدود ۷۳ درصد موارد نیز چهره‌ی قابل‌اعتمادتر را برگزید؛ هر دو رقم بسیار بالاتر از شانس تصادفی بود.

هرچه چهره‌ها از نظر فیزیکی متمایزتر بودند، هوش مصنوعی نیز سازگارتر عمل می‌کرد و در تصاویر بسیار متمایز، در ۹۸ درصد موارد چهره‌ی «مورد انتظار» را شایسته‌تر می‌دانست. مقایسه‌ی این پاسخ‌ها با تحلیل مجدد داده‌های قدیمی انسانی نشان‌دهنده‌ی شکاف قابل‌توجهی بود؛ هرچند نویسندگان تأکید می‌کنند این مقایسه صرفاً یک نمایش است نه مقایسه‌ی دقیق. برآورد می‌شود انسان‌ها در حدود ۶۳ درصد موارد چهره‌ی مورد انتظار را انتخاب می‌کردند، در حالی که این رقم برای جی‌پی‌تی-۴او حدود ۸۸ درصد بود. در میان متمایزترین چهره‌ها، نرخ جی‌پی‌تی-۴او به ۹۸ درصد رسید در حالی که برآورد انسانی تقریباً ثابت ماند.

نکته جالب توجه این است که حتی چهره‌ی میمون‌ها نیز همین داوری درباره‌ی قابل‌اعتماد بودن را در پی داشت. در یکی از آزمایش‌ها از عکس‌های میمون‌های رزوس ماکاک (rhesus macaque) استفاده شد که پیش‌تر در پژوهش‌های انسانی درباره‌ی قضاوت چهره‌ی حیوانات آزمایش شده بودند. دلیل اندکی وجود داشت که فکر کنیم هوش مصنوعی بر روی این ترکیب خاص تصاویر و داوری‌ها آموزش دیده باشد. با این حال، جی‌پی‌تی-۴او در حدود ۶۶ درصد موارد، همان چهره‌های میمونی را که انسان‌ها «مهربان» ارزیابی کرده بودند، قابل‌اعتمادتر دانست؛

این سوگیری نقطه‌ی کوری را در آموزش ایمنی هوش مصنوعی آشکار می‌سازد. توسعه‌دهندگان هوش مصنوعی سخت کوشیده‌اند تا سامانه‌های خود را از بیان ادعاهای سوگیرانه درباره‌ی جنسیت، نژاد و سایر مقوله‌های حساس بازدارند و متاسفانه به نظر می رسد این تلاش تنها در حوزه‌های محدودی موفق بوده است.

شرح کامل این مطالعات در آخرین شماره مجله تخصصی پی‌ان‌ای‌اس نکسوس (PNAS Nexus) منتشر شده و در اختیار علاقه مندان قرار دارد.

مترجم: نیروانا محمدحسینی

ZaKi

Who is mahdizk? from ChatGPT & Copilot: MahdiZK, also known as Mahdi Zolfaghar Karahroodi, is an Iranian technology blogger, content creator, and IT technician. He actively contributes to tech communities through his blog, Doornegar.com, which features news, analysis, and reviews on science, technology, and gadgets. Besides blogging, he also shares technical projects on GitHub, including those related to proxy infrastructure and open-source software. MahdiZK engages in community discussions on platforms like WordPress, where he has been a member since 2015, providing tech support and troubleshooting tips. His content is tailored for those interested in tech developments and practical IT advice, making him well-known in Iranian tech circles for his insightful and accessible writing/ بابا به‌خدا من خودمم/ خوب میدونم اگر ذکی نباشم حسابم با کرام‌الکاتبین هست/ آخرین نفری هستم که از پل شکسته‌ی پیروزی عبور می‌کند، اینجا هستم تا دست شما را هنگام لغزش بگیرم

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا