مدل چندوجهی EmbeddingGemma ۲ گوگل برای اجرای آفلاین روی گوشی معرفی شد

این مدل چندوجهی ۷۴۰ میلیون پارامتر دارد و متن، کد، تصویر، صدا و ویدیو را روی دستگاه پردازش می‌کند.

به گزارش سیناپرس، گوگل از EmbeddingGemma ۲، مدل چندوجهی و متن‌باز جدیدی با ۷۴۰ میلیون پارامتر رونمایی کرد که می‌تواند متن، کد، تصویر، ویدیو و صدا را در یک فضای مشترک به بردارهای معنایی تبدیل کند و به‌صورت آفلاین روی گوشی، لپ‌تاپ و دستگاه‌های مختلف اجرا شود.

این مدل با مجوز Apache ۲.۰ منتشر شده و گوگل آن را برای کاربردهایی مانند جست‌وجوی پیشرفته و بازیابی اطلاعات به‌صورت آفلان طراحی کرده است. در این مدل داده‌ها برای پردازش به سرورهای ابری ارسال نمی‌شوند.

EmbeddingGemma ۲ دارای ۷۴۰ میلیون پارامتر است که برای پردازش متن به ۲۷۰ میلیون پارامتر نیاز دارد. همچنین این مدل با تبدیل انواع مختلف محتوا به یک فضای مشترک، امکان جست‌وجوی بین‌وجهی را فراهم می‌کند؛ برای مثال می‌توان با یک پیام صوتی به دنبال بخش خاصی از یک ویدیو گشت یا با یک عبارت متنی میان ساعت‌ها فایل صوتی جست‌وجو کرد.

مشخصات مدل چندوجهی آفلاین EmbeddingGemma ۲ گوگل

گوگل می‌گوید EmbeddingGemma ۲ برای اجرا روی دستگاه‌های دارای منابع محدود بهینه شده است. این مدل روی گوشی پیکسل ۱۱ پرو برای پردازش متن به حدود ۱۹۱ مگابایت رم فعال نیاز دارد. اجرای نسخه کامل چندوجهی نیز حدود ۵۶۷ مگابایت رم مصرف می‌کند.

این مدل بر پایه معماری Gemma ۴ ساخته شده و توکنایزر متنی و رمزگذار صوتی مشترکی با آن دارد. به گفته گوگل، همین موضوع باعث می‌شود EmbeddingGemma ۲ و Gemma ۴ بتوانند در یک خط پردازش مشترک با مصرف حافظه ترکیبی پایین‌تر اجرا شوند.

EmbeddingGemma ۲ همچنین پنجره زمینه ۸۱۹۲ توکنی دارد که چهار برابر نسخه اول EmbeddingGemma است. این ظرفیت امکان پردازش حداکثر ۲۹ تصویر، ۵۸ فریم ویدیو یا حدود ۵.۵ دقیقه صدا را فراهم می‌کند و می‌توان این ورودی‌ها را نیز با یکدیگر ترکیب کرد.

گوگل اعلام کرده EmbeddingGemma ۲ در ارزیابی‌های مربوط به متن، تصویر و صدا برای مدلی با کمتر از یک میلیارد پارامتر عملکرد بالایی دارد و در برخی وظایف با مدل‌های بزرگ‌تر نیز برابری می‌کند یا عملکرد بهتری دارد.

این مدل در بخش کد از MTEB Code به امتیاز ۷۸.۶۸ رسیده است، درحالی‌که امتیاز EmbeddingGemma قبلی ۶۸.۷۶ بوده است. گوگل این افزایش ۹.۹۲ امتیازی را به‌عنوان بهبود عملکرد مدل در وظایف مرتبط با کد معرفی کرده است.

به نقل از دیجیاتو، البته EmbeddingGemma ۲ با وجود پشتیبانی از بیش از ۱۰۰ زبان، برای همه زبان‌ها عملکرد یکسانی ندارد و خود گوگل نیز این محدودیت را در مستندات مدل ذکر کرده است. این مدل همچنین فاقد تنظیمات ایمنی (Safety Tuning) و تعدیل خروجی (Output Moderation) است. گوگل می‌گوید اقدامات کاهشی مرتبط با ایمنی در مرحله آموزش داده‌ها اعمال شده‌اند.

EmbeddingGemma ۲ با مجوز Apache ۲.۰ عرضه شده و وزن‌های آن از طریق Hugging Face و Kaggle در دسترس قرار گرفته‌اند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا