نماد سایت خبرگزاری سیناپرس

سامانه های تشخیص چهره چگونه کار می‌کنند؟

گاهی تلفن همراه فقط با یک نگاه به صورت ما قفلش را باز می‌کند؛ دوربین فرودگاه می‌تواند چهره‌ای را میان میلیون‌ها تصویر جست‌وجو کند و شبکه‌های اجتماعی حتی می‌توانند افراد یک عکس را پیشنهاد دهند. اما پشت این «نگاه» چه اتفاقی می‌افتد؟ آیا رایانه واقعاً چهره ما را می‌شناسد یا فقط شباهت‌های عددی میان تصاویر را محاسبه می‌کند؟

به گزارش سیناپرس، تشخیص چهره در واقع نوعی زیست‌سنجی است؛ یعنی استفاده از یک ویژگی نسبتاً منحصربه‌فرد بدن انسان برای تشخیص یا تأیید هویت. اما برخلاف تصور رایج، رایانه معمولاً چهره را مانند انسان نمی‌بیند. سامانه تصویر را به مجموعه‌ای بسیار بزرگ از اعداد تبدیل می‌کند و سپس با استفاده از الگوهای ریاضی بررسی می‌کند که این اعداد تا چه اندازه با الگوی مربوط به یک فرد دیگر شباهت دارند.

فرآیند معمول را می‌توان در چند مرحله تصور کرد. نخست، دوربین یا تصویر دیجیتال وارد سامانه می‌شود. نرم‌افزار باید چهره را در تصویر پیدا کند؛ کاری که به آن تشخیص چهره یا Face Detection گفته می‌شود. در یک عکس خانوادگی، برای مثال، سیستم ابتدا باید مشخص کند کدام بخش‌های تصویر مربوط به چهره انسان است.

در مرحله بعد، تصویر برای مقایسه آماده می‌شود. زاویه صورت، اندازه، موقعیت چشم‌ها و شرایط تصویربرداری می‌تواند متفاوت باشد؛ بنابراین سامانه معمولاً تصویر را هم‌تراز و تا حدی استاندارد می‌کند. سپس نوبت بخش اصلی کار می‌رسد: استخراج ویژگی‌ها.

در سامانه‌های قدیمی‌تر، پژوهشگران تلاش می‌کردند ویژگی‌هایی مانند فاصله چشم‌ها، شکل بینی یا ساختار کلی صورت را به‌صورت مشخص تعریف کنند. اما سامانه‌های امروزی عمدتاً از یادگیری عمیق و به‌ویژه شبکه‌های عصبی کانولوشنی استفاده می‌کنند. این شبکه‌ها با دیدن تعداد بسیار زیادی تصویر، به‌تدریج یاد می‌گیرند کدام الگوهای تصویری برای تشخیص هویت مفیدتر هستند.

نتیجه این مرحله معمولاً یک تصویر قابل‌خواندن برای انسان نیست، بلکه یک بردار عددی یا اصطلاحاً «تعبیه چهره» است. به زبان ساده، می‌توان تصور کرد که سامانه برای هر چهره یک مختصات بسیار پیچیده در یک فضای ریاضی ایجاد می‌کند. دو تصویر از یک فرد باید در این فضا به یکدیگر نزدیک‌تر باشند و تصاویر دو فرد متفاوت معمولاً فاصله بیشتری داشته باشند. پژوهش NIST و همکاران در سال ۲۰۱۸ نیز دقیقاً نشان داد که شبکه‌های عصبی عمیق، چهره‌ها را به بردارهای فشرده‌ای از ویژگی‌ها تبدیل و سپس میزان شباهت این نمایش‌ها را محاسبه می‌کنند.

اما «تشخیص چهره» دو کاربرد متفاوت دارد که نباید با یکدیگر اشتباه شوند. در تأیید هویت یک‌به‌یک، سامانه می‌پرسد: «آیا این چهره همان شخصی است که ادعا می‌کند؟» برای مثال هنگام باز کردن قفل تلفن. در شناسایی یک‌به‌چند، پرسش متفاوت است: «این چهره متعلق به کدام فرد در میان مجموعه بزرگی از افراد است؟» کاربردهای امنیتی و جست‌وجوی پایگاه‌های تصویری معمولاً به نوع دوم نزدیک‌اند. NIST نیز این دو نوع ارزیابی را به‌طور جداگانه بررسی می‌کند.

در مرحله نهایی، سامانه یک امتیاز شباهت تولید می‌کند. اگر این امتیاز از یک آستانه مشخص بالاتر باشد، سیستم می‌تواند اعلام کند که دو تصویر احتمالاً متعلق به یک فرد هستند. این نکته مهم است: سامانه لزوماً نمی‌گوید «این شخص قطعاً علی است»؛ بلکه بر اساس داده و آستانه تصمیم، میزان شباهت را ارزیابی می‌کند. تغییر آستانه می‌تواند تعداد خطاهای مثبت کاذب و منفی کاذب را تغییر دهد. پژوهش‌های مقایسه‌ای نیز نشان داده‌اند که انتخاب آستانه و کیفیت تصاویر می‌تواند بر عملکرد و حتی تفاوت عملکرد میان گروه‌های جمعیتی اثر بگذارد.

پس چرا سامانه‌ای که در شرایط مناسب بسیار دقیق است، گاهی اشتباه می‌کند؟ پاسخ ساده است: چهره انسان ثابت نیست.  نور، زاویه دوربین، فاصله، کیفیت تصویر، حالت چهره، افزایش سن، پوشش صورت و حتی کیفیت دوربین می‌توانند مسئله را دشوار کنند. علاوه بر این، کیفیت و تنوع تصاویر آموزشی اهمیت زیادی دارد. یک مرور نظام‌مند در سال ۲۰۲۵ نیز تأکید کرد که بسیاری از مجموعه‌داده‌ها از نظر تنوع جمعیت‌شناختی و شرایط واقعی محدودیت دارند و این مسئله می‌تواند قابلیت تعمیم سامانه را کاهش دهد.

موضوع دیگری که در سال‌های اخیر توجه زیادی به خود جلب کرده، تفاوت عملکرد میان گروه‌های جمعیتی است. مطالعه NIST در سال ۲۰۱۹ روی ۱۸/۲۷ میلیون تصویر از ۸/۴۹ میلیون نفر نشان داد که در بسیاری از الگوریتم‌های بررسی‌شده، عملکرد میان گروه‌های مختلف جمعیتی یکسان نیست؛ با این حال، میزان تفاوت به الگوریتم و کاربرد بستگی داشت و نمی‌توان یک حکم کلی درباره همه سامانه‌ها صادر کرد.

نکته جالب این است که انسان نیز همیشه تشخیص‌دهنده بی‌خطایی نیست. در یک مطالعه مشترک NIST، دانشگاه تگزاس در دالاس، دانشگاه مریلند و دانشگاه نیو ساوت ولز در سال ۲۰۱۸، چهار شبکه عصبی عمیق با گروه‌های انسانی متخصص و غیرمتخصص مقایسه شدند. بهترین الگوریتم در آزمون به AUC برابر  ۹۶ درصد رسید؛ میانه کارشناسان شناسایی چهره ۹۳ درصد بود. مهم‌تر اینکه ترکیب قضاوت انسان و الگوریتم، از عملکرد بسیاری از حالت‌های فردی بهتر بود.

در مجموع، سامانه تشخیص چهره را نباید یک «ماشین نگاه‌کننده» تصور کرد. این فناوری در اصل زنجیره‌ای از تشخیص چهره، آماده‌سازی تصویر، استخراج ویژگی، تبدیل ویژگی‌ها به نمایش عددی، مقایسه ریاضی و تصمیم‌گیری بر اساس آستانه است. پیشرفت یادگیری عمیق باعث شده این فرایند بسیار قدرتمندتر شود، اما دقت آن همچنان به کیفیت الگوریتم، داده‌های آموزشی، شرایط تصویربرداری، جمعیت مورد بررسی و نحوه استفاده از نتیجه وابسته است. به همین دلیل، عددی مانند «دقت ۹۹ درصد» بدون دانستن اینکه سامانه روی چه تصاویری، چه افرادی و برای چه کاری آزمایش شده است، به‌تنهایی معنای علمی کاملی ندارد.

گزارش: میتراسادات میرفیضی

خروج از نسخه موبایل