به گزارش از وبسایت cncf
انجمن Volcano، از پروژههای برجسته CNCF، با خوشحالی از راهاندازی Kthena — پروژه فرعی جدیدی که برای توسعهدهندگان و مهندسان MLOps در سطح جهانی طراحی شده است — خبر داد. Kthena یک سیستم Cloud-native با کارایی بالا برای مسیریابی استنتاج مدلهای بزرگ زبان (LLM)، هماهنگسازی و زمانبندی است که بهطور ویژه برای Kubernetes ساخته شده است. 🚀
Kthena بهمنظور مقابله با پیچیدگیهای راهاندازی سرویسهای LLM در تولید طراحی شده و کنترل ریزدانه و انعطافپذیری بیشتری ارائه میدهد. با ویژگیهایی مثل topology-aware scheduling، KV Cache-aware routing و جداسازی Prefill-Decode (PD)، مصرف و بازده پردازش GPU/NPU را بهبود میبخشد و در عین حال تأخیر را کاهش میدهد.
این پروژه بهعنوان یک زیرمجموعه از Volcano، قابلیتهای آن را فراتر از آموزش AI گسترش داده و راهحلی یکپارچه برای چرخه عمر کامل AI فراهم میآورد.
چالش «آخرین مایل» در ارائه سرویسهای LLM
با وجود تحولآفرینی LLMها در صنایع، استقرار کارآمد آنها در Kubernetes هنوز چالشبرانگیز است. توسعهدهندگان با چهار مانع کلیدی روبهرو هستند:
1) مصرف ناموثر منابع: ردپای حافظه پویا در استنتاج LLM—خصوصاً KV cache—بار زیادی بر GPU/NPU وارد میکند. تعادلدهندههای بار سنتی مانند round-robin این پیچیدگیها را در نظر نمیگیرند و منجر به اتلاف منابع یا صفسازی میشوند.
2) معامله بین تأخیر و توان عملیاتی: استنتاج معمولاً دو مرحله دارد—Prefill (محاسبات فشرده) و Decode (محاسبات حافظهمحور). همراهسازی این دو مرحله باعث محدودیت در بهینهسازی میشود. اگرچه PD راهحل مرسوم است، مسیریابی و زمانبندی مؤثر آن هنوز دشوار است.
3) مدیریت چندمدلی: بسیاری از سازمانها همزمان مدلها، نسخهها و LoRA adapterهای متعددی را ارائه میکنند. زمانبندی منصفانه، مدیریت اولویتها و مسیریابی پویا پیادهسازی سختی دارد و برخی را به نقشهبرداری سخت 1:1 بین gatewayها و مدلها وادار میکند.
4) نبود یکپارچگی Native با K8s: بسیاری از راهحلهای فعلی یا از اکوسیستم Kubernetes جدا هستند یا برای عملیات پلتفرم استاندارد بسیار پیچیدهاند.
Kthena: مغز هوشمند برای استنتاج Cloud-native 🧠
Kthena برای رفع این مشکلات طراحی شده است. به جای جایگزینی موتورهای استنتاج موجود (مثل vLLM یا SGLang)، Kthena لایهای از ارکستراسیون هوشمند را بر بالای آنها مینشاند و بهطور عمیق با Kubernetes یکپارچه میشود.
معماری Kthena شامل دو جزء اصلی است:
– Kthena Router: یک روتر چندمدلی و با کارایی بالا که نقطه ورود همه درخواستهای استنتاج است و ترافیک را بر اساس قوانین ModelRoute به سرورهای مدل پشتیبان توزیع میکند.
– Kthena Controller: هواپیمای کنترلی که ارکستراسیون حجم کار و مدیریت چرخه عمر را بر عهده دارد. این کنترلر CRDهایی مانند ModelBooster، ModelServing و AutoScalingPolicy را به منابع زمان اجرا تبدیل میکند، ServingGroupها و نقشها (Prefill/Decode) را هماهنگ میسازد و با awareness از توپولوژی، Gang scheduling، rolling updates و بازیابی از خطا کار میکند. همچنین مقیاسبندی الاستیک را بر اساس سیاستها هدایت میکند.
ویژگیها و مزایای کلیدی
1. ارکستراسیون استنتاج در مقیاس تولید (ModelServing) ⚙️
Kthena یک الگوی سلسلهمراتبی برای حجم کار معرفی میکند (ModelServing -> ServingGroup -> Role). یک API یکپارچه از الگوهای مختلف پشتیبانی میکند؛ از استقرار مستقل تا تفکیک پیچیده PD و Expert Parallelism (EP). مدیریت ساده شده اجازه میدهد یک استقرار گسترده PD بهعنوان یک منبع ModelServing که شامل چندین ServingGroup است، اداره شود.
2. قالبهای استقرار آماده (ModelBooster)
الگوهای از پیشتعریفشده برای مدلهای متداول (از جمله PD) فراهم میکند و به صورت خودکار منابع مسیریابی و چرخه عمر مورد نیاز را تولید میکند. درعینحال امکان کنترل ریزدانه از طریق ModelServing برای سناریوهای پیچیده حفظ میشود.
3. مسیریابی هوشمند و آگاه از مدل
سازگار با OpenAI API؛ ترافیک را بر اساس header یا محتوای body مسیریابی میکند. الگوریتمهای قابلپلاگ (کمترین درخواست، کمترین تأخیر، KV cache-aware، prefix-cache-aware، LoRA affinity و fairness scheduling) پشتیبانی میشوند. قابلیت LoRA hot-swapping امکان تغییر و مسیریابی بدون اختلال را فراهم میآورد. همچنین سیاستهایی مانند canary release، token-level rate limiting و failover را فراهم میکند. با مدیریت منطق مسیریابی بهصورت بومی، نیاز به gateway جداگانهای مثل Envoy کاهش مییابد.
4. مقیاس خودکار مبتنی بر هزینه
مقیاسگذاری همگن بر اساس معیارهای تجاری (CPU/GPU/Memory/Custom) و بهینهسازی ناهمگن برای تخصیص شتابدهندهها بر پایه نسبت cost-to-performance انجام میشود.
5. پشتیبانی گسترده از سختافزار و موتورهای استنتاج
Inference engines مثل vLLM، SGLang، Triton/TGI و دیگران از طریق یک API انتزاعی پشتیبانی میشوند. مدیریت محاسبات ناهمگن امکان ترکیب GPU و NPU را برای همترازی هزینه و SLO فراهم میکند.
6. کنترل جریان داخلی و زمانبندی منصفانه
ترافیک را بر اساس سابقه مصرف اولویتبندی میکند تا از گرسنگی کاربران با اولویت پایین جلوگیری شود. کنترل جریان امکان تعیین محدودیتهای ریزدانه بر اساس کاربر، مدل و طول توکن را میدهد.
عملکرد
در سناریوهایی با درخواستهای طولانی (مثلاً 4096 توکن)، استراتژی «KV-cache-aware + least-request» Kthena نسبت به یک خط مبنا به دستاوردهای قابلتوجهی میرسد: افزایش توان عملیاتی حدود 2.73 برابر، کاهش TTFT و افت تأخیر تا کمتر از 60٪ در برخی تنظیمات مشاهده شده است. برای بارهای مکالمهای و سنگین، awareness از KV cache مزایای تعیینکنندهای دارد.
حمایت جامعه و صنعت
Kthena از زمان آغاز توجه و حمایت بازیگران صنعت را جلب کرده است. حمایتکنندگان رسمی و نظرات آنها شامل موارد زیر است:
— Xiaobo Qi، مدیر خدمات محاسباتی عمومی، Huawei Cloud: Kthena پتانسیل بهرهبرداری از محاسبات متنوع از جمله Ascend را نشان میدهد و دریچهای برای همکاری با توسعهدهندگان جهانی جهت ایجاد اکوسیستمی باز و پررونق فراهم میکند. 🌐
— لی یانگ، مدیر R&D PaaS، China Telecom AI: Kthena با ترکیب زمانبندی یکپارچه و ادغام منابع Volcano، تخصیص دینامیک منابع را ممکن ساخته و میتواند استفاده از منابع را به سطوح بالاتری برساند.
— Paco Xu، سرپرست تیم منبع باز در DaoCloud: راهاندازی Kthena نقطه عطفی در گسترش قابلیتهای واقعی Volcano برای مدلهای عملی است و تیمها را قادر میسازد با هزینه کمتر به زمانبندی هوشمندتر و بهرهوری بالاتر دست پیدا کنند.
— Kong Gu (Huachang Chen)، Cloud Native Business Gateway Lead، Xiaohongshu: تیم Xiaohongshu با سازندگان Kthena برای طراحی استراتژیهای زمانبندی هوشمند مانند micro-traffic scheduling و مدیریت API مدل همکاری کرده است.
— Zhaoxu Lu، سرپرست تیم، مرکز محاسبات هوشمند، China Unicom Cloud: China Unicom Cloud پس از ارزیابی، از طراحی آیندهنگر Kthena و قابلیتهای time-aware و topology-aware آن استقبال کرده است و آن را آماده تولید میداند.
— کوین وانگ، نگهدارنده Volcano و نایبرئیس CNCF TOC: راهاندازی Kthena نشاندهنده حرکت اکوسیستم Volcano به سمت AI-native در Kubernetes است و از تخصص G-scheme برای استنتاج LLM بهره میبرد.
شروع کاوش در Kthena
این تازه آغاز راه است؛ توسعهدهندگان قصد دارند الگوریتمهای زمانبندی کاراتر و بهترین روشهای بیشتری برای استقرار مدلهای بزرگ فراهم کنند. برای مشاهده کد و مشارکت:
https://github.com/volcano-sh/kthena 🔧