اخبار تکنولوژی

LLM ها چگونه فکر می کنند؟ ۵ رویکرد قدرت بخشیدن به نسل بعدی استدلال هوش مصنوعی

استدلال LLM

مدل‌های زبان بزرگ (LLM) از روزهای اولیه تقلید تکمیل خودکار در استروئیدها، راه زیادی را پیموده‌اند. اما تولید متن صاف کافی نیست – هوش واقعی مورد نیاز است استدلال. این به معنای حل مسائل ریاضی، اشکال زدایی کد، نتیجه گیری منطقی و حتی تأمل در اشتباهات است. با این حال، LLM های مدرن برای پیش بینی کلمه بعدی آموزش دیده اند، نه فکر کردن. پس چگونه آنها ناگهان در استدلال بهتر می شوند؟

پاسخ در مجموعه‌ای از تکنیک‌های جدید نهفته است – از مهندسی سریع تا استفاده از ابزارهای عامل – که LLM‌ها را به متفکران روشمند تر تحریک، آموزش می‌دهند یا تبدیل می‌کنند. در اینجا نگاهی به پنج مورد از تاثیرگذارترین استراتژی هایی که LLM های متفکر را به قلمرو جدیدی سوق می دهند، آورده شده است.

۱٫ ایجاد یک زنجیره فکر: آموزش LLM برای “فکر کردن گام به گام”

یکی از قدیمی‌ترین و ماندگارترین تکنیک‌ها برای بهبود استدلال LLM به طرز شگفت‌آوری ساده است: از مدل بخواهید خودش را توضیح دهد.

این روش که به عنوان تحریک زنجیره ای فکر (CoT) شناخته می شود، شامل هدایت مدل برای تولید مراحل میانی استدلال قبل از ارائه پاسخ نهایی است. به عنوان مثال، به جای اینکه بپرسید «۱۷ ضربدر ۲۴ چیست؟»، از مدل می‌گویید «بیایید گام به گام بیندیشیم» و باعث می‌شود که مشکل را حل کند: ۱۷ × ۲۴ = (۲۰ × ۱۷) + (۴ × ۱۷) و غیره.

این ایده که در سال ۲۰۲۲ رسمی شد، همچنان حیاتی است. مدل o1 OpenAI طوری آموزش داده شد که «قبل از پاسخ دادن بیشتر فکر کند» – اساساً زنجیره‌های استدلال CoT مانند را درونی می‌کند. جانشین آن، o3، این کار را با استدلال شبیه سازی شده ادامه می دهد و استنتاج را در میانه راه برای بازتاب و اصلاح پاسخ ها متوقف می کند.

اصل ساده است: با تحمیل مراحل میانی، مدل‌ها از نتیجه‌گیری سریع اجتناب می‌کنند و منطق چند مرحله‌ای را بهتر مدیریت می‌کنند.

۲٫ مقیاس بندی زمان استنتاج: تفکر بیشتر در هر سوال

اگر سؤالی دشوار است، زمان بیشتری را به فکر کردن اختصاص دهید – مردم این کار را می کنند و اکنون LLM ها نیز می توانند.

همچنین ببینید :  Saal.ai و Nutanix SovereignGPT را در رویداد راه اندازی در ابوظبی ارائه می کنند

مقیاس بندی محاسباتی در طول استنتاج با تخصیص محاسبات بیشتر در طول تولید، استدلال را تقویت می کند. به جای یک خروجی واحد، مدل‌ها می‌توانند چندین مسیر استدلال ایجاد کنند، سپس به بهترین آن رأی دهند. این روش «سازگاری خود» به استانداردی برای معیارهای استدلال تبدیل شده است.

O3-mini OpenAI از سه گزینه استدلال (کم، متوسط، زیاد) استفاده می‌کند که تعیین می‌کند مدل قبل از پاسخ‌دهی چه مدت به صورت داخلی استدلال می‌کند. در سطوح بالای تفکر، o3-mini حتی از مدل کامل o1 در کارهای ریاضی و کدنویسی بهتر عمل می کند.

یک تکنیک مرتبط، اجبار بودجه، که در مقاله s1 2025 معرفی شده است: مقیاس بندی زمان آزمون ساده، از نشانه های ویژه برای کنترل عمق استدلال استفاده می کند. با افزودن مکرر نشانه‌های «صبر کن»، مدل تشویق می‌شود تا پاسخ‌های طولانی‌تری تولید کند، خود را بررسی کند و خودش را اصلاح کند. یک علامت پایانی مانند “پاسخ نهایی:” نشان می دهد که چه زمانی باید متوقف شود. این روش با بسط استنتاج بدون تغییر وزن مدل، دقت را بهبود می بخشد – ارتقای مدرن به درخواست کلاسیک “گام به گام فکر کنید”.

مبادله تاخیر برای دقت است و برای کارهای دشوار اغلب ارزشش را دارد.

۳٫ یادگیری تقویتی و یادگیری چند مرحله ای: پاداش دادن به استدلال خوب

تغییر دهنده دیگر بازی: فقط کلمات را پیش بینی نکنید – به منطق صحیح پاداش دهید.

مدل هایی مانند o1 و DeepSeek-R1 از OpenAI با یادگیری تقویتی (RL) آموزش دیده اند تا الگوهای استدلال منطقی را تشویق کنند. این مدل‌ها به جای تقلید ساده از داده‌ها، برای تولید پاسخ‌های چند مرحله‌ای منطقی پاداش می‌گیرند. اولین تکرار DeepSeek-R1، R1-Zero، تنها از RL استفاده کرد – بدون تنظیم دقیق کنترل شده – و رفتار منطقی شگفت‌آور قدرتمندی را توسعه داد.

با این حال، آموزش فقط RL منجر به مشکلاتی مانند بی ثباتی زبان شد. DeepSeek-R1 نهایی از یادگیری چند مرحله ای استفاده می کند: RL برای استنتاج و تنظیم دقیق نظارت شده برای خوانایی بهتر. به طور مشابه، QwQ-32B علی‌بابا یک مدل پایه قوی را با مقیاس‌بندی پیوسته RL ترکیب می‌کند تا به عملکرد ریاضی و کد برتر دست یابد.

همچنین ببینید :  RL بدون آموزش TD - وبلاگ تحقیقاتی هوش مصنوعی برکلی

نتیجه؟ مدل‌هایی که نه تنها پاسخ‌های درست را دریافت می‌کنند، بلکه آن را به دلایل درست انجام می‌دهند – و حتی می‌توانند خود اصلاحی را یاد بگیرند.

۴٫ خود تصحیح و به عقب: استدلال، سپس به عقب

وقتی مدل اشتباه می شود چه اتفاقی می افتد؟ آیا می توان آن را گرفت؟

تا همین اواخر، LLM ها با اصلاح خود دست و پنجه نرم می کردند. در سال ۲۰۲۳، محققان دریافتند که صرفاً درخواست از یک مدل برای “تلاش مجدد” به ندرت پاسخ را بهبود می بخشد – و گاهی اوقات آن را بدتر می کند. اما کار جدید در سال ۲۰۲۵، یک استراتژی کلاسیک هوش مصنوعی را معرفی می کند که اکنون با LLM سازگار شده است.

وانگ و همکاران توسط Tencent AI Lab مشکل «تفکر نکردن» را در مدل‌های سبک o1 شناسایی کرد: آنها به جای پایبندی به یک خط استدلال، بین ایده‌ها می‌پرند. استراتژی رمزگشایی آنها تغییر فکر را جریمه می کند و کاوش عمیق تر هر ایده را تشویق می کند.

در همین حال، یانگ و همکاران. پیشنهاد بازگشت خود – اجازه دادن به مدل زمانی که گیر کرده است به عقب برگردد، سپس مسیرهای جایگزین را کاوش کنید. این منجر به بهبود دقت بیش از ۴۰٪ در مقایسه با رویکردهایی شد که صرفاً به راه حل های استدلالی بهینه متکی هستند.

این نوآوری‌ها به طور موثر قابلیت‌های جستجو و برنامه‌ریزی را در طول استنتاج اضافه می‌کنند و روش‌های کلاسیک هوش مصنوعی مانند جستجوی عمقی را که در بالای قدرت انعطاف‌پذیر LLM‌ها قرار گرفته‌اند، منعکس می‌کنند.

۵٫ استفاده از ابزار و ادغام دانش بیرونی: استدلال فراتر از مدل

گاهی اوقات استدلال به معنای دانستن زمان درخواست کمک است.

LLM های مدرن به طور فزاینده ای از ابزارهای خارجی – ماشین حساب، مفسر کد، API ها، حتی جستجوی وب – برای رسیدگی به پرس و جوهای پیچیده استفاده می کنند.

QwQ-32B علی‌بابا مستقیماً قابلیت‌های عامل را در بر می‌گیرد و به آن امکان فراخوانی توابع یا دسترسی به APIها در حین استنتاج را می‌دهد. Gemini 2.0 (تفکر فلش) گوگل از ویژگی های مشابه پشتیبانی می کند – برای مثال، می تواند اجرای کد را در حین استنتاج فعال کند و به مدل اجازه می دهد تا کد را به عنوان بخشی از فرآیند استدلال خود اجرا و ارزیابی کند.

همچنین ببینید :  چرا هوش مصنوعی باید بتواند شما را "قلاب" کند؟

چرا این مهم است؟ برخی از وظایف – مانند بررسی داده ها در زمان واقعی، انجام ریاضیات نمادین یا اجرای کد – فراتر از قابلیت های داخلی مدل هستند. بارگذاری این وظایف فرعی به LLM اجازه می دهد تا بر منطق مرتبه بالاتر تمرکز کند و به طور چشمگیری دقت و قابلیت اطمینان را بهبود بخشد.

در اصل، ابزارها به LLM ها اجازه می دهند تا بیشتر از وزن خود مشت بزنند – مانند یک چاقوی دیجیتال ارتش سوئیس که استدلال را با ابزارهای دقیق گسترش می دهد.

نتیجه: استدلال یک پشته است، نه یک سوئیچ

LLM ها فقط “استدلال را یاد می گیرند” در یک مرحله – آنها آن را از طریق مجموعه لایه ای از تکنیک ها به دست می آورند که شامل یادگیری، تحریک، استنتاج و تعامل با جهان است. درخواست CoT ساختار را اضافه می کند. مقیاس بندی زمان استنتاج به عمق می افزاید. RL تراز را اضافه می کند. عقبگرد به خودآگاهی می افزاید. استفاده از ابزار دامنه را اضافه می کند.

مدل‌های با عملکرد برتر مانند o1 و o3 OpenAI، R1 DeepSeek، Google's Gemini 2.0 Flash Thinking، و Alibaba's QwQ چندین مورد از این استراتژی‌ها را با هم ترکیب می‌کنند – یک کتاب بازی ترکیبی که مهندسی هوشمند را با داربست‌های شناختی ترکیب می‌کند.

همانطور که این زمینه در حال تکامل است، انتظار داشته باشید که پیوند نزدیک‌تر بین فرآیندهای استدلال داخلی و ابزارهای تصمیم‌گیری خارجی وجود داشته باشد. ما بیشتر و بیشتر به LLM هایی نزدیک می شویم که فقط کلمه بعدی را حدس نمی زنند – بلکه واقعاً من فکر می کنم.

آیا این مقاله را دوست دارید؟ برای به روز رسانی های بیشتر هوش مصنوعی ثبت نام کنید.

هنگامی که مقالات گردآوری بیشتری مانند این را منتشر کنیم، به شما اطلاع خواهیم داد.

لینک منبع

نویسنده اصلی

وب سایت 123 سلکت یک مجله مرجع جهت معرفی و راهنمای خرید و انتخاب سریع بهترین کالا ها و محصولات در زمینه های مختلف و متنوع است
دکمه بازگشت به بالا