OpenForgeRL؛ آموزش عاملهای همراستا با Harness در هر محیط
خلاصه کاربردی
OpenForgeRL چارچوبی متنباز برای آموزش تقویتی انتهابهانتهای عاملهایی ارائه میکند که از harnessهای استنتاج حالتمند استفاده میکنند. در این معماری، یک proxy فراخوانیهای مدل در harness را ثبت میکند تا سامانههای استاندارد یادگیری تقویتی بتوانند از آنها برای آموزش استفاده کنند. همچنین Kubernetes هر rollout را در یک کانتینر جداگانه اجرا میکند تا محیط اجرای عاملها ایزوله و قابل مدیریت باشد.
این چارچوب روی محیطهای مختلفی از جمله استفاده از ابزار، مرورگر، رابط کاربری گرافیکی و تعامل با رایانه ارزیابی شده است.
نکته فنی مهم
نکته کلیدی OpenForgeRL کاهش فاصله میان harness واقعی عامل و زیرساخت متداول آموزش RL است. بهجای آنکه منطق عامل برای سازگاری با یک محیط آموزشی ساده بازنویسی شود، proxy فراخوانیهای مدل را از همان harness مورد استفاده در استقرار دریافت و برای سامانه آموزش ثبت میکند. اجرای هر rollout در کانتینر مستقل Kubernetes نیز امکان جداسازی محیطها و مدیریت اجرای همزمان آزمایشها را فراهم میکند.
کاربرد برای توسعهدهندگان
توسعهدهندگانی که روی عاملهای ابزارمحور، مرورگرمحور یا عاملهای استفادهکننده از رایانه کار میکنند، میتوانند از این رویکرد برای آموزش عامل در محیطی نزدیکتر به شرایط واقعی استفاده کنند. این معماری بهویژه زمانی مفید است که عامل به وضعیت داخلی، چندین گام تعامل و ابزارهای خارجی وابسته باشد و بازسازی آن در یک محیط RL ساده دشوار شود.
همچنین جداسازی rolloutها در Kubernetes میتواند به طراحی آزمایشهای تکرارپذیرتر و مدیریت بهتر منابع محاسباتی در فرایند آموزش کمک کند.
منبع اصلی
عنوان مقاله: OpenForgeRL: Train Harness-native Agents in Any Environment
arXiv: https://arxiv.org/abs/2607.21557
تاریخ انتشار: 2026-07-23
نویسندگان: Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao
برداشت من
برداشت من از این مطلب این است که ارزش اصلی OpenForgeRL در نزدیککردن فرایند آموزش به محیط واقعی اجرای عاملهاست؛ رویکردی که میتواند توسعه عاملهای چندمرحلهای و ابزارمحور را عملیتر کند و نیاز به بازطراحی محیط برای سازگاری با زیرساخت RL را کاهش دهد.
هنوز دیدگاهی تایید نشده است.