آخرین مطالب

7 مطلب

OpenForgeRL؛ آموزش عامل‌های هم‌راستا با Harness در هر محیط

OpenForgeRL یک چارچوب متن‌باز برای آموزش تقویتی انتهابه‌انتهای عامل‌هایی است که از محیط‌های استنتاج حالت‌مند استفاده می‌کنند. این چارچوب با ثبت فراخوانی‌های مدل از طریق یک proxy و اجرای rolloutهای ایزوله با Kubernetes، آموزش عامل‌ها را در محیط‌هایی مانند ابزارها، مرورگر، GUI و استفاده از رایانه ممکن می‌کند.

ادامه مطلب

مدیریت چرخه‌عمری زمینه در عامل‌های هوشمند؛ راهکاری برای کنترل حافظه و هزینه

این پژوهش مدیریت حافظه و زمینه در عامل‌های هوشمند را مسئله‌ای چرخه‌عمری و معماری می‌داند، نه صرفاً ذخیره‌سازی و بازیابی. چارچوب پیشنهادی پنج primitive شامل معماری‌گذاری، ورود داده، تعیین دامنه، پیش‌بینی و فشرده‌سازی یا تجمیع دارد و در پیاده‌سازی مرجع به امتیاز ۹۲٪ در LongMemEval و ۹۳٫۲٪ در LoCoMo رسیده است.

ادامه مطلب

بهبود تنظیمات OpenTelemetry و مدیریت مدل در GitHub Copilot برای JetBrains

افزونه GitHub Copilot برای JetBrains امکان تنظیم خروجی OpenTelemetry، تعیین سقف توکن ورودی و خروجی برای BYOK و endpointهای سفارشی، فعال‌سازی یا غیرفعال‌سازی مدل‌ها، استفاده از MCP server و عامل‌های سفارشی در جریان‌های Claude و عیب‌یابی بهتر MCP را اضافه کرده است.

ادامه مطلب

پشتیبانی GitHub MCP Server از مشخصات جدید و بدون‌حالت MCP

GitHub MCP Server از مشخصات جدید و بدون‌حالت MCP پشتیبانی می‌کند؛ نشست‌های مبتنی بر Redis و عملیات پایگاه‌داده در زمان initialize حذف شده‌اند، پردازش درخواست‌ها ساده‌تر شده و آزمون‌های رسمی انطباق نیز به پروژه اضافه شده‌اند.

ادامه مطلب

کدنویسی عامل‌محور بدون ابر؛ ارزیابی مدل‌های زبانی بازوزن در آماده‌سازی داده‌های طولی

پژوهش حاضر چارچوب متن‌باز RRBench را برای ارزیابی عامل‌های مبتنی بر مدل‌های زبانی بازوزن در ۲۰ وظیفه آماده‌سازی داده‌های طولی معرفی می‌کند. این وظایف شامل همسان‌سازی دسته‌ها و ادغام داده‌های چندموجی است و مدل‌های ۳۱ تا ۳۵ میلیاردپارامتری توانسته‌اند روی سخت‌افزار مصرفی به حداکثر نرخ ۸۷٫۹ درصد تکمیل وظیفه برسند.

ادامه مطلب

انتشار OpenHands Agent Canvas v1.6.1 برای ترمیم انتشار npm

نسخهٔ اصلاحی OpenHands Agent Canvas برای بازیابی انتشار npm پس از tombstone شدن بستهٔ v1.6.0 منتشر شده است. این تغییر برای تیم‌هایی که انتشار خودکار، رجیستری بسته و مدیریت خطاهای انتشار را کنترل می‌کنند، اهمیت عملی دارد.

ادامه مطلب

کمتر کپی کنید، بیشتر به شواهد متصل بمانید: بهبود استدلال با زمینهٔ طولانی

مقالهٔ «Copy Less, Ground More» مشکل کپی‌کردن تکراری را در استدلال مدل‌های زبانی با زمینهٔ طولانی بررسی می‌کند. روش GEAR با پاداش‌دادن به استفاده از شواهد مرتبط و جریمه‌کردن بازتولید محتوای مزاحم، در مقایسه با یادگیری تقویتی مبتنی بر دقت، تا ۴٫۶ امتیاز بهبود میانگین ایجاد می‌کند و طول فرایند استدلال را کاهش می‌دهد.

ادامه مطلب