اخبار تکنولوژی

چگونه به یک برند جهانی FMCG کمک کردیم تا بیش از ۱۰۰۰۰۰ سند با کیفیت را با هوش مصنوعی پردازش کند

خودکارسازی بیش از 100000 برچسب محصول برای انطباق با استفاده از هوش مصنوعیخودکارسازی بیش از 100000 برچسب محصول برای انطباق با استفاده از هوش مصنوعی

در اینجا آمده است که چگونه به یک برند جهانی FMCG کمک کردیم تا بیش از ۱۰۰۰۰۰ برچسب محصول را برای انطباق با هوش مصنوعی بدون از دست دادن دقت پردازش کند.

وقتی یک تولیدکننده جهانی FMCG به ما مراجعه کرد، مشکل کمبود داده نبود. خیلی زیاد بود، در قالب اشتباه گرفتار شد.

هر دسته از محصولاتی که از امکانات تولیدی خود خارج می‌شدند دارای برچسب محصول، یک فایل PDF با لیست مواد تشکیل دهنده، اطلاعات تغذیه‌ای، داده‌های انطباق با مقررات و امضاهای گواهی بود. آن را در چندین خط تولید و سالهای کار ضرب کنید و تعداد آن از ۱۰۰۰۰۰ سند فراتر رود. قبل از اینکه بتوان بایگانی کرد یا وارد سیستم‌های انطباق پایین‌دستی شود، هر کدام باید بازبینی می‌شد، فیلدهای کلیدی استخراج و بر اساس استانداردهای نظارتی تأیید می‌شد.

این به صورت دستی توسط یک تیم نظارتی و انطباق انجام شد که هر فایل PDF را خواند، مقادیر را در صفحات گسترده یا سیستم های رکورد کپی کرد و خطاها را بررسی کرد. کار می کند اما مقیاس نمی شود. هر خط محصول جدید، هر چرخه ممیزی، هر بازار جدید برچسب های بیشتری را به صفی اضافه می کرد که از قبل خیلی طولانی بود.

خلاصه ای از مشتری ساده بود: بازیابی و اعتبارسنجی این برچسب های محصول را با استفاده از خودکار پردازش اسناد هوش مصنوعیبدون به خطر انداختن دقتی که فرآیندهای انطباق جهانی آنها به آن بستگی دارد.

تست کیفیت کالاهای با جابجایی سریعتست کیفیت کالاهای با جابجایی سریع

چرا این یک مشکل ساده OCR نیست

روی کاغذ، راه حل آسان به نظر می رسد – فایل های PDF را از طریق آن اجرا کنید خط لوله استخراج هوش مصنوعیامتیاز اعتماد را بررسی کرده و تایید کنید. ما قبلاً این فرض را دیده‌ایم، و از تماس با اسناد واقعی تولید جان سالم به در نمی‌برد.

اسناد برچسب FMCG به روش‌های معمولی به هم ریخته می‌شوند ابزارهای OCR برای ایجاد نشده اند. برخی از آنها برچسب های آزمایشی تمیز و چاپ شده هستند. خیلی ها نیستند. مقامات نظارتی اصلاحات را با دست در زمینه ها می نویسند. هنگامی که یک عبارت یا الزامات مطابقت تغییر می کند، متن خط زده و بازنویسی می شود. تمبرها روی متن چاپ شده همپوشانی دارند. برخی از اسناد فرم های اسکن شده ای هستند که به سختی خوانا هستند. خط لوله ای که فقط متن چاپ شده ساده را پردازش می کند، بخش معنی داری از اسناد دنیای واقعی مشتری را با شکست مواجه می کند، و در صنعتی مبتنی بر انطباق مانند FMCG، “کسر معنی دار” عددی نیست که بتوان آن را نادیده گرفت.

همچنین ببینید :  14 بهترین ابزار هوش مصنوعی برای توسعه دهندگان در سال 2026

بنابراین قبل از نوشتن خطی از منطق استخراج، ما زمانی را با تیم نظارتی مشتری گذراندیم تا بفهمیم این برچسب‌ها در عمل چه شکلی هستند، نه فقط در بهترین حالت چه شکلی هستند.

تله ارزیابی اعتماد در سند هوش مصنوعی

نسخه اول همه سند خط لوله هوش مصنوعی تمایل دارد از یک امتیاز اطمینان واحد برای هر سند استفاده کند: اگر مدل، مثلاً ۹۰ درصد به طور کلی مطمئن است، آن را تأیید کنید. اگر نه، آن را برای شخص ارسال کنید.

این رویکرد در اوایل ما را شکست داد، و ارزش توضیح دلیل آن را دارد. یک سند ممکن است به طور کلی ۹۵٪ اطمینان دریافت کند در حالی که یک فیلد خاص، مثلاً یک شماره مجوز نظارتی یا یک هشدار حساس آلرژن، اشتباه است. امتیاز کل یک میانگین برای هر فیلد در صفحه است. چند فیلد ساده و واضح می‌تواند میانگین را بالا ببرد و زمینه‌ای را بپوشاند که هم خواندن آن دشوار است و هم رشته‌ای که واقعاً برای صدور گواهینامه اهمیت دارد.

حرکت کردیم به ارزیابی اطمینان در سطح میدانی در عوض هر فیلد جداگانه، نه سند به عنوان یک کل، امتیاز اعتماد خود را دریافت می کند. فقط فیلدهایی که کمتر از حد معینی هستند به بازبین ارجاع داده می شوند. بقیه موارد به صورت خودکار تایید می شوند.

این تغییر واحد تأثیر زیادی داشت. این بدان معنی است که ممتحنین کل اسناد را برای بررسی فیلدهایی که هوش مصنوعی قبلاً به درستی استخراج کرده بود باز نمی کردند. آنها به دو یا سه زمینه، از اغلب بیست یا بیشتر، نگاه می کردند که سیستم واقعاً در مورد آنها مطمئن نبود. این تفاوت بین بازبینی کننده ای است که یک سند کامل را بازخوانی می کند و بازبینی کننده ای که پانزده ثانیه را در یک زمینه برجسته می گذراند.

با دست خط، مهر و خط زدن کار کنید

مدارک روی برچسب محصول در محیط‌های FMCG، اوراق کاری هستند، نه فرم‌های اولیه. کارمندان یک مقدار اصلی را خط زده و مقدار تنظیم شده را در کنار آن می نویسند. تمبرها روی “تأیید شده” یا “تست مجدد” اعمال می شوند و قسمت زیر را تا حدی مبهم می کنند. وضوح اسکن ها بسته به اینکه کدام مرکز آنها را تولید کرده است بسیار متفاوت است.

همچنین ببینید :  این روش مدل های هوش مصنوعی مولد را برای بومی سازی اشیاء سفارشی آموزش می دهد | اخبار MIT

ما پردازش خاصی را برای هر یک از این الگوها ایجاد کردیم، به جای اینکه آنها را به عنوان نویز OCR برای میانگین تلقی کنیم. یک جزئیات در طول آزمایش ما را شگفت زده کرد: در چندین مورد هوش مصنوعی مقدار خط خورده را به درستی شناسایی کرد و تصمیم گرفت آن را بازیابی نکند و آن را به عنوان جایگزین تلقی کرد که رفتار صحیحی است، اما این بدان معنا بود که گردش کار اعتبارسنجی به جای تلقی هر ضربه به عنوان یک شکست واکشی، به یک مسیر صریح برای “اصلاحی در اینجا انجام شد” نیاز داشت. ما یک پرچم بازبینی جداگانه مخصوصاً برای اسنادی با اصلاحات قابل مشاهده اضافه کرده‌ایم تا بازبین‌ها بتوانند به سرعت تأیید کنند که هوش مصنوعی مقدار تصحیح شده را گرفته است و نه نسخه اصلی.

آگاه کردن عمدی مردم

هیچ کدام از اینها حذف تیم نظارتی از این روند نبود. این در مورد تغییر کاری بود که وقت خود را صرف انجام آن می کردند.

قبل از اینکه خط لوله فعال شود، هر گردش کار توسط کارشناسان دامنه مشتری در برابر فرآیند دستی موجود آنها تأیید شد. ما خروجی هوش مصنوعی را در برابر اسنادی که قبلاً به صورت دستی اسکن شده بودند آزمایش کردیم، تا زمانی که دقت بازیابی به طور مداوم در انواع برچسب‌ها، تجهیزات و کیفیت‌های اسکن مختلف حفظ شود. این مرحله اعتبار سنجی به زمان واقعی نیاز داشت و ما آن را غیرقابل مذاکره در نظر گرفتیم، خط لوله ای که در نسخه آزمایشی دقیق به نظر می رسد و خط لوله ای که به اندازه کافی دقیق است که بتوان برای صدور گواهینامه انطباق جهانی اعتماد کرد، یکسان نیستند.

پس از پخش زنده، نقش بازبین تغییر کرد. به‌جای خواندن هر جلد سند، بازبین‌ها از صفی از فیلدهای پرچم‌دار کار می‌کردند، فیلدهایی که هوش مصنوعی واقعاً به آنها اطمینان نداشت، به علاوه اسنادی با اصلاحات قابل مشاهده یا قالب‌بندی غیرمعمول. افراد ماهر در تیم همان قضاوتی را انجام می‌دادند که همیشه داشتند، فقط در مورد موارد بسیار کوچک‌تر و بسیار مرتبط‌تر اعمال می‌شد.

همچنین ببینید :  داده های مصنوعی برای هوش مصنوعی چیست؟ - دن رز هوش مصنوعی

نتیجه: کاهش ۸۰ درصدی تلاش برای بازبینی دستی

  • پایان ۱۰۰۰۰۰ سند از طریق خط لوله عبور کرد.
  • استخراج دقت در سطح زمین به بیش از ۹۰٪ رسیددر مقایسه با معیارهای دستی خود مشتری اعتبارسنجی شده است.
  • تلاش بازبینی دستی تقریباً ۸۰٪ کاهش یافته استزیرا بازبین‌ها فقط به فیلدهای پرچم‌گذاری شده و اسناد پرچم‌گذاری شده نگاه می‌کنند، نه هر صفحه.
  • زمان پردازش، که یک مانع ثابت برای تیم انطباق بود، به طور قابل توجهی کاهش یافت.
  • عقب ماندگی که با هر چرخه حسابرسی جدید افزایش می یافت، از رشد بازماند.
  • عددی که برای مشتری اهمیت بیشتری داشت یک درصد نبود.
  • تیم کیفی آنها، افرادی که سال ها صرف قضاوت کرده بودند تا بدانند چه زمانی یک ارزش نامناسب به نظر می رسد، در نهایت از آن قضاوت در مورد اسنادی استفاده کردند که واقعاً به آن نیاز داشتند.

به هر کسی که به پردازش اسناد هوش مصنوعی فکر می کند چه می گوییم؟

اگر یک درس از این پروژه ارزش تکرار داشته باشد، این است AI را در یک صنعت تنظیم شده یا حساس به کیفیت مستند می کند انتخاب مدل مشکلی نیست. این یک مسئله طراحی گردش کار است. مدل اشتقاق بخشی از سیستمی است که همچنین به امتیازدهی سطح اطمینان، یک مسیر تشدید واضح برای موارد مبهم مانند دست خط و اصلاحات، و مرحله اعتبارسنجی که به اندازه کافی دقیق است که افرادی که به آن متکی هستند واقعاً به آن اعتماد کنند، نیاز دارد.

این ترکیب چیزی است که «ما هوش مصنوعی را بر روی اسناد خود اجرا کردیم» را به فرآیندی تبدیل می‌کند که تیم انطباق در واقع پشت سر آن خواهد ایستاد.

اگر تعداد اسناد، گزارش‌های کیفیت، سوابق انطباق، نتایج آزمایشگاهی یا موارد مشابه دارید و بررسی دستی به یک گلوگاه تبدیل شده است، خوشحال می‌شویم در مورد اینکه جریان کاری مانند این برای داده‌های شما چگونه است صحبت کنیم.


لینک منبع

نویسنده اصلی

وب سایت 123 سلکت یک مجله مرجع جهت معرفی و راهنمای خرید و انتخاب سریع بهترین کالا ها و محصولات در زمینه های مختلف و متنوع است
دکمه بازگشت به بالا