نماد سایت خبرگزاری سیناپرس

پژوهشگران اپل ابزار جدیدی برای ارزیابی عامل‌های هوش مصنوعی توسعه دادند

پژوهشگران اپل چارچوبی به نام Agent Seer توسعه داده‌اند که می‌تواند بر اساس مشخصات ابزارهای مبتنی بر پروتکل MCP، به‌صورت خودکار سناریوهای آزمایشی برای ارزیابی عامل‌های هوش مصنوعی ایجاد کند؛ با این حال، نتایج این پژوهش نشان می‌دهد تشخیص ابزار مناسب، لزوماً به معنای ارسال صحیح اطلاعات به آن نیست و دقت مقادیر ورودی همچنان یکی از مهم‌ترین چالش‌ها در این فرایند است.

به گزارش سیناپرس، پروتکل Model Context Protocol یا MCP امکان اتصال مدل‌ها و عامل‌های هوش مصنوعی به ابزارها و سرویس‌های مختلف را فراهم می‌کند. در این محیط، یک عامل هوش مصنوعی باید علاوه بر انتخاب ابزار مناسب، پارامترهای مورد نیاز آن را نیز به شکل صحیح تعیین کند.

Agent Seer با استفاده از اطلاعات موجود در مشخصات MCP، از جمله نام ابزار، توضیحات عملکرد و طرح‌واره پارامترها، ابتدا سناریوهای مختلفی از وظایف کاربران ایجاد می‌کند. سپس برای هر سناریو، فراخوانی‌های مورد انتظار ابزارها و خروجی‌های مصنوعی تولید می‌شود. این خروجی‌ها امکان ایجاد گفت‌وگوهای چندمرحله‌ای را نیز فراهم می‌کنند تا در مراحل بعدی، عامل بتواند از اطلاعات به‌دست‌آمده در مراحل قبلی استفاده کند.

بر اساس مقاله منتشرشده درباره این چارچوب، پژوهشگران ۳۳۷ سناریو و ۳۹۱ رکورد ارزیابی در هفت مشخصات MCP را بررسی کردند. انتخاب ابزار در ۷۷ درصد از رکوردها به‌طور کامل موفق بود، اما تنها ۴۲ درصد از موارد در بخش آرگومان‌ها امتیاز کامل دریافت کردند. در ۵۷ درصد موارد نیز عملکرد در این بخش جزئی گزارش شد.

تحلیل خطاها نشان داد دقت مقدار پارامترها یکی از اصلی‌ترین نقاط ضعف است؛ به‌گونه‌ای که این مؤلفه در ۲۲۳ رکورد، پایین‌ترین امتیاز را میان زیربخش‌های مربوط به آرگومان‌ها داشت.

برای مثال، یک عامل ممکن است ابزار و عملیات صحیح را انتخاب کند و حتی برخی پارامترهای آن را درست وارد کند، اما شناسه، تاریخ، مسیر یا زمان انقضای نادرستی ارسال کند. چنین خطایی می‌تواند باعث شود یک عملیات در محیط واقعی با شکست مواجه شود، حتی اگر انتخاب ابزار کاملاً صحیح بوده باشد.

پژوهشگران همچنین هشدار می‌دهند که تولید مقادیر معتبر از نظر ساختاری، به معنای معتبر بودن آنها در دنیای واقعی نیست. برای نمونه، یک شناسه ممکن است از نظر نوع داده صحیح باشد اما در سامانه وجود نداشته باشد یا یک تاریخ از نظر قالب درست باشد اما با قوانین سرویس سازگار نباشد.

با وجود این محدودیت‌ها، Agent Seer می‌تواند برای افزایش پوشش آزمون‌ها و شناسایی سریع‌تر خطاهای عامل‌های هوش مصنوعی مورد استفاده قرار گیرد. با این حال، پژوهشگران تأکید دارند که آزمون‌های مصنوعی نمی‌توانند جایگزین کامل آزمایش‌های واقعی شوند؛ زیرا مسائلی مانند سطح دسترسی، وضعیت سرور، داده‌های خارجی، قوانین تجاری و پیامدهای اجرای واقعی عملیات تنها در محیط عملیاتی قابل بررسی هستند.

در نتیجه، یافته‌های این پژوهش بر ضرورت ارزیابی چندبعدی عامل‌های هوش مصنوعی تأکید دارد؛ ارزیابی‌ای که علاوه بر انتخاب ابزار، صحت، کامل بودن و معنای واقعی مقادیر ورودی و همچنین عملکرد عامل در محیط واقعی را نیز در نظر بگیرد.

مترجم:سروش ساده

خروج از نسخه موبایل