داده های مصنوعی برای هوش مصنوعی چیست؟ – دن رز هوش مصنوعی

این مقاله گزیده ای از کتاب آینده من است که می توانید در اینجا مشترک شوید: https://www.danrose.ai/book.
صادقانه بگویم، داده های مصنوعی در هوش مصنوعی احتمالاً موضوعی است که در حال حاضر بیشتر به آن فکر می کنم. پتانسیل زیادی دارد برای بهبود حریم خصوصی، کاهش تعصب و بهبود دقت مدل به طور همزمان در یک جهش بزرگ فناوری در سال های آینده. گارتنر حتی اظهار داشت:تا سال ۲۰۲۴، ۶۰ درصد از داده های مورد استفاده برای توسعه پروژه های هوش مصنوعی و تحلیلی به صورت مصنوعی تولید می شود.با توجه به اینکه بسیاری از افرادی که امروزه با هوش مصنوعی کار می کنند، حتی شروع به پذیرش این فناوری نکرده اند، این یک بازی را تغییر می دهد.
داده های مصنوعی داده ها هستند، اما مشاهدات واقعی جهان نیستند. این داده های جعلی است که توسط انسان ها یا الگوریتم ها ایجاد شده است. این به صورت مصنوعی یا مصنوعی ایجاد میشود، اما هدف مشابه دادههای واقعی است – نشان دادن دنیایی که قرار است هوش مصنوعی در آن کار کند. این ایده که داده ها برای آموزش مدل های هوش مصنوعی باید به طور دقیق جهان را نشان دهند، هنوز وسیله ای برای رسیدن به هدف است. در نهایت، هدف از ساخت هوش مصنوعی مدل هایی است که به طور دقیق پیش بینی می کنند تا یک تجربه کاربری خوب را ارائه دهند.
انواع داده های مصنوعی
بسته به نوع داده، متن، تصاویر و داده های جدولی، رویکردها و موارد استفاده متفاوتی وجود دارد.
متون مصنوعی
برای زبان و نوشتار هوش مصنوعی، میتوانید متنهای مصنوعی را تولید کنید که شبیه آنهایی هستند که در دنیای واقعی پیدا میکنید. حتی ممکن است برای یک انسان بیهوده به نظر برسد، اما اگر در هنگام استفاده از داده های آموزشی، کار نمایش جهان را انجام دهد، به اندازه کافی خوب است.
من قبلاً این رویکرد را در مورد طبقه بندی متن اعمال کرده ام. من این روش را انتخاب کردم زیرا داده ها را فقط می توان برای سه ماه ذخیره کرد و حفظ سیگنال های فصلی خاص را دشوار می کند. دادههای واقعی را که به یک مدل زبانی دادهام بردم و مدل را بهطور دقیق تنظیم کردم تا بتواند دادههایی شبیه به دادههای واقعی تولید کند. سپس میتوانیم دادههای نامحدود برای هر برچسب بدون دادههای شخصی برای آموزش مدلهای هوش مصنوعی تولید کنیم.
تصاویر مصنوعی
برای تصاویر، می توان از یک مدل متن به تصویر استفاده کرد که می تواند تصاویر مصنوعی را به سادگی با درخواست کاربر با متن ایجاد کند. معروف ترین نسخه این مدل DALL-E 2 انویدیا است که تصاویر واقعی شگفت انگیزی تولید می کند. نسخه منبع باز موجود در HuggingFace به نام DALL-E Mini را می توان به صورت رایگان در اینجا امتحان کرد: https://huggingface.co/spaces/dalle-mini/dalle-mini. شما می توانید مدل را با یک متن کوتاه مانند “توت فرنگی در یک مربع” درخواست کنید و نه تلاش از مدل برای ایجاد تصویری از یک توت فرنگی در یک مربع دریافت می کنید.
از آنجایی که الگوی متن باز است، می توانید آن را نیز دانلود کرده و برای پروژه های خود استفاده کنید.
تصاویر تولید شده توسط DALL-E Mini ممکن است واقعی نباشند، اما همچنان برای آموزش مدل های هوش مصنوعی به اندازه کافی خوب هستند.
می توانید خودتان آن را امتحان کنید. به DALL-E Mini بروید و از مدل بخواهید تصاویری از موز و سیب بسازد. از جملاتی مانند «موز روی میز» یا «موز روی یک پسزمینه تصادفی» استفاده کنید. همین کار را با سیب انجام دهید تا حدود ۳۰ تصویر از هر کدام داشته باشید. اکنون می توانید این تصاویر را در Teachable Machine آپلود کنید تا یک موز در مقابل تشخیص سیب بسازید. من قول می دهم که کار خواهد کرد. اگر شما را کمی تحت تاثیر قرار نمی دهد که می توانید هوش مصنوعی تشخیص شی را از تصاویر کاملا مصنوعی ایجاد کنید، پس من نمی دانم چه کاری انجام می دهد.
موارد استفاده در اینجا بسیار است. شما می توانید به صورت مصنوعی اشیایی را ایجاد کنید که انتظار دارید اما در داده های آموزشی ندیده اید. همچنین میتوانید اشیاء ساده را روی پسزمینههای تصادفی قرار دهید تا مطمئن شوید که سناریوهای ناآشنا را پوشش میدهید. این همچنین کیفیت مدل ها را افزایش می دهد زیرا تغییر در محیط اهمیت کمتری دارد.
داده های جدولی مصنوعی
داده های جدولی نیز می توانند به صورت مصنوعی تولید شوند. این در مراقبت های بهداشتی محبوب است زیرا مراقبت های بهداشتی در برابر مشکلات داده بسیار آسیب پذیر است. علاوه بر ترکیب بی پایان سناریوها با بیماری های مختلف و داروهای متقابل، مسئله حریم خصوصی نیز وجود دارد. داده های تاریخچه تشخیصی و درمانی بیمار می تواند آنقدر منحصر به فرد باشد که بتواند افراد را شناسایی کند. با تولید نسخههای مصنوعی دادههای واقعی، دادهها را میتوان برای پوشش بهتر سناریوهای نادر و ناشناس کردن دادهها افزایش داد. این امر به اشتراک گذاری بین محققان و کارشناسان پزشکی را تسهیل می کند.
مدل های دنیا
با مدلهای مصنوعی دنیا، ما همچنین میتوانیم راهحلهای هوش مصنوعی را قبل از انتشار آنها آزمایش کنیم و به آنها آموزش دهیم که با کسری از هزینه بهتر شوند. خودروهای خودران یک مورد عالی برای این کار هستند. خودروهای خودران را می توان با ساختن یک مدل مصنوعی از جهان نزدیک به دنیای واقعی با فیزیک و سناریوهای تصادفی سریعتر و ایمن تر توسعه داد. امروزه بسیاری از شرکتهایی که خودروهای خودران تولید میکنند، از مدلهای ساخته شده در موتور Unity استفاده میکنند که در اصل برای توسعه بازیهای رایانهای طراحی شده بود. ماشینها را میتوان بدون اینکه انسانها در دنیای مجازی میلیونها بار قبل از انتشار در معرض خطر قرار گیرند، آزمایش، تصادف کرد و بهبود بخشید.
مزایا و معایب داده های مصنوعی
مزایای استفاده از داده های مصنوعی در تصمیمات شما بسیار است. می تواند داده های بیشتری را با هزینه کمتر برای بهبود دقت مدل ها فراهم کند. میتواند با هموارسازی دادهها با افزودن ویژگیها یا برچسبهای نادری که برای برخی گروهها مضر است، سوگیری را حذف کند. همچنین ممکن است حریم خصوصی افرادی را که اطلاعات شخصی آنها بخشی از داده های آموزشی باشد بهبود بخشد. همچنین می تواند به ما امکان آزمایش سناریوهای شناخته شده و ناشناخته را بدهد.
اما آیا همه چیز خوب است؟ نه. داده های مصنوعی یک گلوله نقره ای نیستند. این با خطر اضافه کردن سوگیری یا حذف داده ها از جهانی است که قرار است نشان دهد. چالش این است که شناسایی علت انحراف دشوار است زیرا دادههای مصنوعی اغلب در جایی که دادههای واقعی کمبود دارند استفاده میشوند و طبق تعریف یک چالش بررسی واقعیت است. داده های مصنوعی یک راه حل امیدوارکننده برای بسیاری از مشکلات است، اما با دقت از آن استفاده کنید. از آنجایی که تعداد کمی از داده های مصنوعی در هوش مصنوعی تجربه دارند، ما از بسیاری از چالش های پیش رو آگاه نیستیم.
برای راهنمایی های بیشتر، برای کتاب اینجا ثبت نام کنید: https://www.danrose.ai/book.
