کمتر کپی کنید، بیشتر به شواهد متصل بمانید: بهبود استدلال با زمینهٔ طولانی
خلاصه کاربردی
در وظایفی که مدل زبانی باید میان حجم زیادی از متن جستوجو و استدلال کند، همیشه طولانیتر نوشتن به معنای استدلال بهتر نیست. یکی از خطاهای رایج در این شرایط، «کپیکردن تکراری» است؛ یعنی مدل بخشهایی از زمینه، بهویژه محتوای مزاحم یا نامرتبط، را بدون نقش واقعی در حل مسئله در پاسخ خود بازتولید میکند.
مقالهٔ Copy Less, Ground More روش GEAR را معرفی میکند؛ روشی برای شکلدهی پاداش در یادگیری تقویتی که مدل را به همپوشانی با شواهد مرتبط تشویق و کپیکردن محتوای مزاحم را جریمه میکند. بر اساس نتایج گزارششده، GEAR در مقایسه با یادگیری تقویتی مبتنی بر دقت، تا ۴٫۶ امتیاز بهبود میانگین به دست میآورد و همزمان طول استدلال را کاهش میدهد.
نکته فنی مهم
نکتهٔ کلیدی این روش، جداکردن «استفاده از شواهد» از «تکرار متن» است. اگر پاداش فقط بر اساس درستبودن پاسخ نهایی تعیین شود، مدل ممکن است برای افزایش احتمال موفقیت، بخشهای زیادی از زمینه را کپی کند؛ حتی زمانی که این بخشها برای پاسخ ضروری نیستند.
GEAR با افزودن سیگنالهای پاداش مبتنی بر شواهد، به مدل کمک میکند بین محتوای مرتبط و محتوای مزاحم تمایز بگذارد. بنابراین هدف آموزش فقط رسیدن به پاسخ صحیح نیست، بلکه رسیدن به پاسخ صحیح با اتکای روشنتر به اطلاعات لازم و با مسیر استدلال کوتاهتر است. این رویکرد میتواند مشکل بهرهوری پایین در پنجرههای متنی بزرگ را کاهش دهد.
کاربرد برای توسعهدهندگان
این یافته برای توسعهدهندگان سامانههای RAG، عاملهای هوشمند و ابزارهای پرسشوپاسخ مبتنی بر اسناد اهمیت دارد. در چنین سامانههایی، ارزیابی نباید فقط دقت پاسخ نهایی را اندازهگیری کند؛ میزان اتکا به قطعههای مرتبط، مقدار بازتولید متن و طول فرایند استدلال نیز باید در نظر گرفته شود.
- برای هر پاسخ، ارتباط میان ادعاها و قطعههای بازیابیشده را ارزیابی کنید.
- در دادههای آموزشی، میان استفاده از شواهد مرتبط و کپیکردن متن تمایز بگذارید.
- طول پاسخ و تعداد توکنهای فرایند استدلال را در کنار دقت اندازهگیری کنید.
- در طراحی پاداش یا ارزیابی، برای محتوای مزاحم و تکرار غیرضروری جریمه در نظر بگیرید.
در عمل، این رویکرد میتواند به کاهش هزینهٔ پردازش، پاسخهای خواناتر و استفادهٔ دقیقتر از زمینهٔ طولانی منجر شود؛ البته کیفیت بازیابی شواهد و تعریف درست معیار ارتباط همچنان نقش تعیینکنندهای دارد.
منبع اصلی
عنوان: Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning
نویسندگان: Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang
تاریخ انتشار: ۲۱ ژوئیهٔ ۲۰۲۶
arXiv: https://arxiv.org/abs/2607.19345
برداشت من
برداشت من از این مطلب این است که در سامانههای مبتنی بر زمینهٔ طولانی، پاسخ خوب فقط پاسخ درست نیست؛ پاسخ باید نشان دهد مدل از کدام شواهد استفاده کرده و تا حد امکان از بازتولید متنهای نامرتبط دوری کرده است. ترکیب معیارهای دقت، ارتباط شواهد و طول استدلال میتواند مسیر عملیتری برای ساخت سامانههای RAG و عاملهای کمهزینهتر و قابلاعتمادتر فراهم کند.
هنوز دیدگاهی تایید نشده است.