تکامل ایمنی عاملهای زبانی با یادگیری از خطاهای اجرا
خلاصه کاربردی
پژوهش SHE یا Safety Harness Evolution رویکردی برای بهبود تدریجی لایهٔ ایمنی عاملهای مبتنی بر مدلهای زبانی ارائه میکند. در این رویکرد، مهارکنندهٔ ایمنی به چهار بخش مستقل تقسیم میشود: اعلان سامانه، بانک قوانین، حافظهٔ ایمنی و سیاست ابزار.
ایدهٔ اصلی این است که هر خطای عامل در زمان اجرا فقط بهعنوان یک شکست کلی ثبت نشود؛ بلکه با استفاده از سازوکار انتساب، مسئولیت خطا به بخش مرتبط نسبت داده شود و همان بخش بهصورت موضعی بهروزرسانی شود. طبق گزارش مقاله، این روش در Agent-SafetyBench نرخ موفقیت حمله را نسبت به یک مهارکنندهٔ ایستا ۳٫۱ برابر کاهش داده و قابلیت انتقال آن به AgentHarm و مدلهای عامل دیگر نیز گزارش شده است.
نکته فنی مهم
نکتهٔ مهم در SHE این است که ایمنی فقط با تغییر وزنهای مدل یا تنظیم اعلان سامانه به دست نمیآید. عامل هنگام استفاده از ابزارها، خواندن و نوشتن حافظه و تصمیمگیری در چند مرحله، سطح حملهٔ گستردهتری ایجاد میکند. بنابراین، کنترل ایمنی باید در چند لایه اعمال شود.
- اعلان سامانه: چارچوب کلی رفتار و محدودیتهای عامل را مشخص میکند.
- بانک قوانین: قواعد قابل بازبینی و تکمیل را در اختیار مهارکننده قرار میدهد.
- حافظهٔ ایمنی: تجربههای مرتبط با خطاها و موقعیتهای پرخطر را نگهداری میکند.
- سیاست ابزار: مشخص میکند عامل در چه شرایطی و با چه محدودیتهایی میتواند ابزارها را فراخوانی کند.
این تفکیک، بهروزرسانی ایمنی را دقیقتر میکند؛ زیرا هر خطا لزوماً به تغییر همزمان همهٔ اجزای مهارکننده نیاز ندارد.
کاربرد برای توسعهدهندگان
برای توسعهدهندگان عاملهای زبانی، این پژوهش یک الگوی عملی برای طراحی حلقهٔ بازخورد ایمنی پیشنهاد میکند. بهجای آنکه پس از هر خطا کل اعلان سامانه بازنویسی شود، میتوان مسیر اجرای عامل را بررسی کرد، نقطهٔ ایجاد خطا را تشخیص داد و تنها قانون، رکورد حافظه یا سیاست ابزار مرتبط را اصلاح کرد.
این معماری میتواند در سامانههایی که به ابزارهای بیرونی دسترسی دارند، به کاهش ریسک تغییرات گسترده و پیشبینینشده کمک کند. همچنین ارزیابی مهارکننده باید فقط بر پاسخ نهایی مدل متمرکز نباشد؛ مسیر اجرای عامل، تصمیمهای مربوط به فراخوانی ابزار و نحوهٔ استفاده از حافظه نیز باید در آزمونهای ایمنی بررسی شوند.
منبع اصلی
عنوان مقاله: SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
arXiv: https://arxiv.org/abs/2608.09885
تاریخ انتشار: 2026-08-10
نویسندگان: Wanying Qu; Qinghua Mao; Yu Li; Jiyao Liu; Xin Zhang; Dadi Guo; Yanxu Zhu; Qingyu Liu; Leitao Yuan; Xi Lin; Shanfeng Zhu; Yanwei Fu; Jing Shao; Xia Hu; Dongrui Liu
برداشت من
برداشت من از این مطلب این است که ایمنی عاملها باید مانند یک سامانهٔ قابلتکامل طراحی شود، نه یک اعلان ثابت که فقط در ابتدای اجرای مدل قرار میگیرد. جدا کردن قوانین، حافظه و سیاست ابزار از اعلان سامانه، امکان تحلیل دقیقتر خطا و اصلاح کمدامنهتر را فراهم میکند. بااینحال، اثربخشی چنین رویکردی به کیفیت تشخیص مسئولیت خطا و پوشش ارزیابیهای ایمنی وابسته است؛ بنابراین، توسعهدهندگان باید همزمان با بهبود مهارکننده، مسیرهای اجرای عامل و رفتار ابزارها را نیز بهطور مستمر آزمایش کنند.
هنوز دیدگاهی تایید نشده است.