کمتر کپی کنید، بیشتر به شواهد متصل بمانید: بهبود استدلال با زمینهٔ طولانی
مقالهٔ «Copy Less, Ground More» مشکل کپیکردن تکراری را در استدلال مدلهای زبانی با زمینهٔ طولانی بررسی میکند. روش GEAR با پاداشدادن به استفاده از شواهد مرتبط و جریمهکردن بازتولید محتوای مزاحم، در مقایسه با یادگیری تقویتی مبتنی بر دقت، تا ۴٫۶ امتیاز بهبود میانگین ایجاد میکند و طول فرایند استدلال را کاهش میدهد.
ادامه مطلب