دستیابی گوگل به استنتاج تا ۴٫۷ برابر سریعتر برای Qwen 3.5 با بهینهسازی TPU و پشته سروینگ
گوگل در گزارشی فنی توضیح داده است که چگونه مدل متنباز Qwen 3.5-397B از نوع Mixture-of-Experts را روی شتابدهندههای Ironwood TPU v7x بهینه کرده است. ترکیب موازیسازی داده، موازیسازی متخصصان، کرنلهای سفارشی JAX/Pallas، بهینهسازی ارتباطات بین تراشهها و مدیریت دقیق حافظه، به بهبود تقریبی ۳٫۱ برابری در مرحله Decode و ۴٫۷ برابری در مرحله Prefill انجامیده است. ادغام این بهینهسازیها با vLLM و SGLang، استقرار مدلهای بسیار بزرگ را برای سازمانها عملیتر میکند.
ادامه مطلب