آخرین مطالب

28 مطلب

دستیابی گوگل به استنتاج تا ۴٫۷ برابر سریع‌تر برای Qwen 3.5 با بهینه‌سازی TPU و پشته سروینگ

گوگل در گزارشی فنی توضیح داده است که چگونه مدل متن‌باز Qwen 3.5-397B از نوع Mixture-of-Experts را روی شتاب‌دهنده‌های Ironwood TPU v7x بهینه کرده است. ترکیب موازی‌سازی داده، موازی‌سازی متخصصان، کرنل‌های سفارشی JAX/Pallas، بهینه‌سازی ارتباطات بین تراشه‌ها و مدیریت دقیق حافظه، به بهبود تقریبی ۳٫۱ برابری در مرحله Decode و ۴٫۷ برابری در مرحله Prefill انجامیده است. ادغام این بهینه‌سازی‌ها با vLLM و SGLang، استقرار مدل‌های بسیار بزرگ را برای سازمان‌ها عملی‌تر می‌کند.

ادامه مطلب