اخبار تکنولوژی

این روش مدل های هوش مصنوعی مولد را برای بومی سازی اشیاء سفارشی آموزش می دهد | اخبار MIT

فرض کنید شخصی بولداگ فرانسوی خود بوزر را به پارک سگ می برد. شناسایی Bowser هنگام بازی در میان سایر سگ ها برای صاحب سگ در حالی که در محل است آسان است.

اما اگر کسی بخواهد از یک مدل هوش مصنوعی مولد مانند GPT-5 برای نظارت بر حیوان خانگی خود در حین کار استفاده کند، ممکن است مدل در این کار اصلی شکست بخورد. مدل‌های زبان بصری مانند GPT-5 اغلب در تشخیص اشیاء عمومی مانند سگ برتری دارند، اما در بومی‌سازی اشیاء شخصی‌شده مانند Bowser the French Bulldog عملکرد ضعیفی دارند.

برای رفع این نقص، محققان MIT، آزمایشگاه هوش مصنوعی واتسون MIT-IBM، موسسه علوم Weizmann و جاهای دیگر روش آموزشی جدیدی را معرفی کردند که مدل‌های زبان بصری را برای مکان‌یابی اشیاء شخصی‌شده در یک صحنه آموزش می‌دهد.

روش آنها از داده های ردیابی ویدیویی با دقت آماده شده استفاده می کند که در آن یک شیء مشابه در فریم های متعدد ردیابی می شود. آنها مجموعه داده را طوری طراحی کردند که مدل به جای تکیه بر دانش از قبل حفظ شده، بر سرنخ های زمینه ای برای شناسایی شی شخصی سازی شده متمرکز شود.

هنگامی که چندین تصویر نمونه که یک شیء سفارشی شده، مانند حیوان خانگی شخصی را نشان می دهد، داده می شود، مدل آموزش دیده بهتر می تواند مکان همان حیوان خانگی را در یک تصویر جدید شناسایی کند.

مدل‌هایی که با روش‌های خود آموزش‌دیدند، در این کار از سیستم‌های پیشرفته پیشی گرفتند. نکته مهم این است که تکنیک آنها بقیه توانایی های کلی مدل را دست نخورده باقی می گذارد.

این رویکرد جدید می‌تواند به سیستم‌های هوش مصنوعی آینده در ردیابی اشیاء خاص در طول زمان، مانند کوله‌پشتی کودک، یا مکان‌یابی اشیاء مورد علاقه، مانند گونه‌های جانوری در پایش محیطی کمک کند. همچنین می تواند به توسعه فناوری های کمکی مبتنی بر هوش مصنوعی کمک کند که به کاربران کم بینا کمک می کند تا اشیاء خاصی را در یک اتاق پیدا کنند.

جهانزب میرزا، فوق دکترای MIT و نویسنده ارشد تکنیک مقاله، می گوید: “در نهایت، ما می خواهیم که این مدل ها بتوانند از بافت بیاموزند، درست مانند انسان ها. اگر یک مدل بتواند این کار را به خوبی انجام دهد، به جای اینکه آن را برای هر کار جدید بازآموزی کنیم، فقط می توانیم چند مثال ارائه دهیم و این یک توانایی بسیار قدرتمند است.”

همچنین ببینید :  چگونه مسیر بعید این بنیانگذار به سیلیکون ولی می تواند به یک مزیت در فناوری صنعتی تبدیل شود

سیوان دووه، یکی از محققان فوق دکترا در دانشگاه استنفورد که در زمان انجام این تحقیق دانشجوی مؤسسه علوم وایزمن بود، به میرزا در این گزارش پیوسته است. و نمرود شبتای، محقق در IBM Research. جیمز گلس، محقق ارشد و رهبر گروه سیستم‌های زبان گفتاری در آزمایشگاه علوم کامپیوتر و هوش مصنوعی MIT (CSAIL). و دیگران این کار در کنفرانس بین المللی بینایی کامپیوتر ارائه خواهد شد.

یک نقص غیر منتظره

محققان دریافته‌اند که مدل‌های زبانی بزرگ (LLM) می‌توانند از یادگیری از زمینه بهتر عمل کنند. اگر به LLM چندین مثال از یک کار، مانند مشکلات جمع، داده شود، او می تواند پاسخ به مسائل اضافه جدید را بر اساس زمینه ارائه شده بیاموزد.

مدل زبان بصری (VLM) اساساً یک LLM است که یک جزء بصری به آن متصل است، بنابراین محققان MIT فکر کردند که فرصت‌های یادگیری را در زمینه LLM به ارث خواهد برد. اما این چنین نیست.

میرزا می گوید: “جامعه پژوهشی هنوز پاسخ سیاه و سفیدی برای این مشکل خاص پیدا نکرده است. گلوگاه ممکن است از این واقعیت ناشی شود که برخی از اطلاعات بصری در فرآیند ادغام این دو جزء با هم از بین می روند، اما ما فقط نمی دانیم.”

محققان به دنبال بهبود توانایی VLM برای بومی سازی در زمینه هستند، که شامل یافتن یک شی خاص در یک تصویر جدید است. آنها بر روی داده های مورد استفاده برای آموزش مجدد VLM های موجود برای یک کار جدید، فرآیندی به نام تنظیم دقیق، تمرکز کردند.

داده‌های تنظیم دقیق معمولی از منابع تصادفی جمع‌آوری می‌شوند و مجموعه‌ای از اشیاء روزمره را به تصویر می‌کشند. یک تصویر ممکن است اتومبیل‌هایی را نشان دهد که در یک خیابان پارک شده‌اند، در حالی که تصویر دیگری یک دسته گل را نشان می‌دهد.

همچنین ببینید :  گروه سافت بانک 75 میلیارد یورو برای ساخت 5 گیگاوات ظرفیت مرکز داده هوش مصنوعی در فرانسه سرمایه گذاری می کند

او می‌گوید: «هیچ انسجام واقعی در این داده‌ها وجود ندارد، بنابراین مدل هرگز یاد نمی‌گیرد که یک شیء مشابه را در تصاویر متعدد تشخیص دهد.

برای حل این مشکل، محققان یک مجموعه داده جدید را با بررسی نمونه‌هایی از داده‌های ردیابی ویدیوی موجود توسعه دادند. این داده‌ها ویدیوهایی هستند که نشان می‌دهند همان سوژه در حال حرکت در یک صحنه، مانند قدم زدن ببر در یک مرتع.

آنها فریم‌های این ویدئوها را بریده می‌کنند و مجموعه داده را طوری ساختار می‌دهند که هر ورودی شامل چندین تصویر باشد که یک شی را در زمینه‌های مختلف نشان می‌دهد، با نمونه سوالات و پاسخ‌هایی درباره مکان آن.

میرزا توضیح می‌دهد: «با استفاده از چندین تصویر از یک شی در زمینه‌های مختلف، ما مدل را تشویق می‌کنیم که به طور مداوم آن شی مورد نظر را با تمرکز بر زمینه بومی‌سازی کند».

تمرکز اجباری

اما محققان دریافتند که VLM ها تمایل به تقلب دارند. آنها به جای پاسخ دادن بر اساس سرنخ های زمینه، شی را با استفاده از دانش به دست آمده در طول یادگیری قبلی شناسایی می کنند.

به عنوان مثال، از آنجایی که مدل قبلاً آموخته است که تصویر یک ببر و برچسب “ببر” مرتبط است، می‌تواند بر اساس این دانش از قبل آموزش‌دیده، ببری را که از علفزار عبور می‌کند شناسایی کند، به جای استنباط از زمینه.

برای حل این مشکل، محققان از نام های شبه به جای نام های واقعی دسته های اشیا در مجموعه داده ها استفاده کردند. در این صورت نام ببر را به «چارلی» تغییر دادند.

او می گوید: “مدتی طول کشید تا بفهمیم چگونه از تقلب مدل جلوگیری کنیم. اما ما بازی را برای مدل تغییر دادیم. مدل نمی داند که “چارلی” می تواند یک ببر باشد، بنابراین مجبور است به زمینه نگاه کند.”

محققان همچنین در یافتن بهترین راه برای تهیه داده ها با چالش هایی روبرو هستند. اگر فریم‌ها خیلی نزدیک به هم باشند، پس‌زمینه آنقدر تغییر نمی‌کند که تنوع داده‌ها را فراهم کند.

همچنین ببینید :  بررسی خطرات و مشکلات توسعه عامل هوش مصنوعی

در نهایت، تنظیم دقیق VLM با این مجموعه داده جدید، دقت محلی سازی سفارشی را به طور متوسط ​​حدود ۱۲ درصد بهبود بخشید. هنگامی که آنها مجموعه داده نام های شبه را وارد کردند، بهبود عملکرد به ۲۱ درصد رسید.

با افزایش اندازه مدل، تکنیک آنها منجر به افزایش عملکرد می شود.

در آینده، محققان می‌خواهند دلایل احتمالی را بررسی کنند که چرا VLMها توانایی‌های یادگیری در زمینه را از LLMهای پایه خود به ارث نمی‌برند. علاوه بر این، آنها قصد دارند مکانیسم های اضافی را برای بهبود عملکرد VLM بدون نیاز به آموزش مجدد با داده های جدید بررسی کنند.

“این اثر بومی‌سازی شی شخصی‌شده چند شات را – با تطبیق با همان شی در صحنه‌های جدید – به‌عنوان یک مشکل تنظیم دستورالعمل بازسازی می‌کند و از دنباله‌های ردیابی ویدئو برای آموزش بومی‌سازی بر اساس زمینه بصری به جای کلاس‌های قبلی به VLM استفاده می‌کند. همچنین اولین معیار برای این تنظیم را با دستاوردهای قابل‌توجه در اهمیت باز و اختصاصی VLM با توجه به ویژگی‌های خاص erap معرفی می‌کند. زمین – اغلب بدون تنظیم دقیق – برای کاربران جریان های کاری در دنیای واقعی (مانند روباتیک، دستیاران واقعیت افزوده، ابزارهای خلاقانه و غیره)، دستور عملی داده محور ارائه شده توسط این کار می تواند به بهبود پذیرش گسترده مدل های زبان بصری اولیه کمک کند.

نویسندگان دیگر وی لین، همکار پژوهشی در دانشگاه یوهانس کپلر هستند. الی شوارتز، محقق در IBM Research; هیلد کوئنه، استاد علوم کامپیوتر در مرکز هوش مصنوعی Tuebingen و دانشیار آزمایشگاه هوش مصنوعی MIT-IBM Watson; راجا گیریس، دانشیار دانشگاه تل آویو؛ روجریو فریس، دانشمند اصلی و مدیر آزمایشگاه هوش مصنوعی MIT-IBM Watson; لئونید کارلینسکی، دانشمند ارشد IBM Research; آساف اربل، پژوهشگر ارشد در IBM Research. و شیمون اولمن، استاد سامی و روث کوهن در علوم کامپیوتر در موسسه علوم وایزمن.

این تحقیق تا حدی توسط آزمایشگاه هوش مصنوعی MIT-IBM Watson AI تامین شده است.

لینک منبع

نویسنده اصلی

وب سایت 123 سلکت یک مجله مرجع جهت معرفی و راهنمای خرید و انتخاب سریع بهترین کالا ها و محصولات در زمینه های مختلف و متنوع است
دکمه بازگشت به بالا