آخرین مطالب

9 مطلب

وقتی منبع تأییدشده به ورودی حمله تبدیل می‌شود: دفاع از قراردادهای هوشمند در برابر اسکن آسیب‌پذیری مبتنی بر مدل‌های زبانی

مقالهٔ «When Verified Source Becomes Attack Input» چارچوب DeLLMGuard را معرفی می‌کند؛ روشی برای حفظ افشای عمومی کد قراردادهای هوشمند و در عین حال دشوارتر کردن اسکن گستردهٔ آسیب‌پذیری با عامل‌های مبتنی بر مدل زبانی. این چارچوب با استفاده از روابط proxy، delegate و factory، کد منبع افشاشده را از منطق اجرای زمان‌اجرا جدا می‌کند و روی ۳۸۷ قرارداد آسیب‌پذیر با سه عامل زبانی ارزیابی شده است.

ادامه مطلب

تکامل ایمنی عامل‌های زبانی با یادگیری از خطاهای اجرا

پژوهش SHE چارچوبی برای تکامل ایمنی مهارکنندهٔ عامل‌های زبانی معرفی می‌کند که اعلان سامانه، بانک قوانین، حافظهٔ ایمنی و سیاست ابزار را از یکدیگر جدا می‌کند. این چارچوب با تحلیل خطاهای اجرای عامل و اعمال به‌روزرسانی‌های موضعی، در Agent-SafetyBench نرخ موفقیت حمله را در مقایسه با مهارکنندهٔ ایستا ۳٫۱ برابر کاهش داده است.

ادامه مطلب

OpenForgeRL؛ آموزش عامل‌های هم‌راستا با Harness در هر محیط

OpenForgeRL یک چارچوب متن‌باز برای آموزش تقویتی انتهابه‌انتهای عامل‌هایی است که از محیط‌های استنتاج حالت‌مند استفاده می‌کنند. این چارچوب با ثبت فراخوانی‌های مدل از طریق یک proxy و اجرای rolloutهای ایزوله با Kubernetes، آموزش عامل‌ها را در محیط‌هایی مانند ابزارها، مرورگر، GUI و استفاده از رایانه ممکن می‌کند.

ادامه مطلب

مدیریت چرخه‌عمری زمینه در عامل‌های هوشمند؛ راهکاری برای کنترل حافظه و هزینه

این پژوهش مدیریت حافظه و زمینه در عامل‌های هوشمند را مسئله‌ای چرخه‌عمری و معماری می‌داند، نه صرفاً ذخیره‌سازی و بازیابی. چارچوب پیشنهادی پنج primitive شامل معماری‌گذاری، ورود داده، تعیین دامنه، پیش‌بینی و فشرده‌سازی یا تجمیع دارد و در پیاده‌سازی مرجع به امتیاز ۹۲٪ در LongMemEval و ۹۳٫۲٪ در LoCoMo رسیده است.

ادامه مطلب

پشتیبانی GitHub MCP Server از مشخصات جدید و بدون‌حالت MCP

GitHub MCP Server از مشخصات جدید و بدون‌حالت MCP پشتیبانی می‌کند؛ نشست‌های مبتنی بر Redis و عملیات پایگاه‌داده در زمان initialize حذف شده‌اند، پردازش درخواست‌ها ساده‌تر شده و آزمون‌های رسمی انطباق نیز به پروژه اضافه شده‌اند.

ادامه مطلب

کدنویسی عامل‌محور بدون ابر؛ ارزیابی مدل‌های زبانی بازوزن در آماده‌سازی داده‌های طولی

پژوهش حاضر چارچوب متن‌باز RRBench را برای ارزیابی عامل‌های مبتنی بر مدل‌های زبانی بازوزن در ۲۰ وظیفه آماده‌سازی داده‌های طولی معرفی می‌کند. این وظایف شامل همسان‌سازی دسته‌ها و ادغام داده‌های چندموجی است و مدل‌های ۳۱ تا ۳۵ میلیاردپارامتری توانسته‌اند روی سخت‌افزار مصرفی به حداکثر نرخ ۸۷٫۹ درصد تکمیل وظیفه برسند.

ادامه مطلب

بهبود تنظیمات OpenTelemetry و مدیریت مدل در GitHub Copilot برای JetBrains

افزونه GitHub Copilot برای JetBrains امکان تنظیم خروجی OpenTelemetry، تعیین سقف توکن ورودی و خروجی برای BYOK و endpointهای سفارشی، فعال‌سازی یا غیرفعال‌سازی مدل‌ها، استفاده از MCP server و عامل‌های سفارشی در جریان‌های Claude و عیب‌یابی بهتر MCP را اضافه کرده است.

ادامه مطلب

انتشار OpenHands Agent Canvas v1.6.1 برای ترمیم انتشار npm

نسخهٔ اصلاحی OpenHands Agent Canvas برای بازیابی انتشار npm پس از tombstone شدن بستهٔ v1.6.0 منتشر شده است. این تغییر برای تیم‌هایی که انتشار خودکار، رجیستری بسته و مدیریت خطاهای انتشار را کنترل می‌کنند، اهمیت عملی دارد.

ادامه مطلب