به گزارش از وبسایت cncf

انجمن Volcano، از پروژه‌های برجسته CNCF، با خوشحالی از راه‌اندازی Kthena — پروژه فرعی جدیدی که برای توسعه‌دهندگان و مهندسان MLOps در سطح جهانی طراحی شده است — خبر داد. Kthena یک سیستم Cloud-native با کارایی بالا برای مسیریابی استنتاج مدل‌های بزرگ زبان (LLM)، هماهنگ‌سازی و زمان‌بندی است که به‌طور ویژه برای Kubernetes ساخته شده است. 🚀

Kthena به‌منظور مقابله با پیچیدگی‌های راه‌اندازی سرویس‌های LLM در تولید طراحی شده و کنترل ریزدانه و انعطاف‌پذیری بیشتری ارائه می‌دهد. با ویژگی‌هایی مثل topology-aware scheduling، KV Cache-aware routing و جداسازی Prefill-Decode (PD)، مصرف و بازده پردازش GPU/NPU را بهبود می‌بخشد و در عین حال تأخیر را کاهش می‌دهد.

این پروژه به‌عنوان یک زیرمجموعه از Volcano، قابلیت‌های آن را فراتر از آموزش AI گسترش داده و راه‌حلی یکپارچه برای چرخه عمر کامل AI فراهم می‌آورد.

چالش «آخرین مایل» در ارائه سرویس‌های LLM

با وجود تحول‌آفرینی LLMها در صنایع، استقرار کارآمد آن‌ها در Kubernetes هنوز چالش‌برانگیز است. توسعه‌دهندگان با چهار مانع کلیدی روبه‌رو هستند:

1) مصرف ناموثر منابع: ردپای حافظه پویا در استنتاج LLM—خصوصاً KV cache—بار زیادی بر GPU/NPU وارد می‌کند. تعادل‌دهنده‌های بار سنتی مانند round-robin این پیچیدگی‌ها را در نظر نمی‌گیرند و منجر به اتلاف منابع یا صف‌سازی می‌شوند.

2) معامله بین تأخیر و توان عملیاتی: استنتاج معمولاً دو مرحله دارد—Prefill (محاسبات فشرده) و Decode (محاسبات حافظه‌محور). همراه‌سازی این دو مرحله باعث محدودیت در بهینه‌سازی می‌شود. اگرچه PD راه‌حل مرسوم است، مسیریابی و زمان‌بندی مؤثر آن هنوز دشوار است.

3) مدیریت چندمدلی: بسیاری از سازمان‌ها هم‌زمان مدل‌ها، نسخه‌ها و LoRA adapterهای متعددی را ارائه می‌کنند. زمان‌بندی منصفانه، مدیریت اولویت‌ها و مسیریابی پویا پیاده‌سازی سختی دارد و برخی را به نقشه‌برداری سخت 1:1 بین gatewayها و مدل‌ها وادار می‌کند.

4) نبود یکپارچگی Native با K8s: بسیاری از راه‌حل‌های فعلی یا از اکوسیستم Kubernetes جدا هستند یا برای عملیات پلتفرم استاندارد بسیار پیچیده‌اند.

Kthena: مغز هوشمند برای استنتاج Cloud-native 🧠

Kthena برای رفع این مشکلات طراحی شده است. به جای جایگزینی موتورهای استنتاج موجود (مثل vLLM یا SGLang)، Kthena لایه‌ای از ارکستراسیون هوشمند را بر بالای آن‌ها می‌نشاند و به‌طور عمیق با Kubernetes یکپارچه می‌شود.

معماری Kthena شامل دو جزء اصلی است:

– Kthena Router: یک روتر چندمدلی و با کارایی بالا که نقطه ورود همه درخواست‌های استنتاج است و ترافیک را بر اساس قوانین ModelRoute به سرورهای مدل پشتیبان توزیع می‌کند.

– Kthena Controller: هواپیمای کنترلی که ارکستراسیون حجم کار و مدیریت چرخه عمر را بر عهده دارد. این کنترلر CRDهایی مانند ModelBooster، ModelServing و AutoScalingPolicy را به منابع زمان اجرا تبدیل می‌کند، ServingGroupها و نقش‌ها (Prefill/Decode) را هماهنگ می‌سازد و با awareness از توپولوژی، Gang scheduling، rolling updates و بازیابی از خطا کار می‌کند. همچنین مقیاس‌بندی الاستیک را بر اساس سیاست‌ها هدایت می‌کند.

ویژگی‌ها و مزایای کلیدی

1. ارکستراسیون استنتاج در مقیاس تولید (ModelServing) ⚙️

Kthena یک الگوی سلسله‌مراتبی برای حجم کار معرفی می‌کند (ModelServing -> ServingGroup -> Role). یک API یکپارچه از الگوهای مختلف پشتیبانی می‌کند؛ از استقرار مستقل تا تفکیک پیچیده PD و Expert Parallelism (EP). مدیریت ساده شده اجازه می‌دهد یک استقرار گسترده PD به‌عنوان یک منبع ModelServing که شامل چندین ServingGroup است، اداره شود.

2. قالب‌های استقرار آماده (ModelBooster)

الگوهای از پیش‌تعریف‌شده برای مدل‌های متداول (از جمله PD) فراهم می‌کند و به صورت خودکار منابع مسیریابی و چرخه عمر مورد نیاز را تولید می‌کند. درعین‌حال امکان کنترل ریزدانه از طریق ModelServing برای سناریوهای پیچیده حفظ می‌شود.

3. مسیریابی هوشمند و آگاه از مدل

سازگار با OpenAI API؛ ترافیک را بر اساس header یا محتوای body مسیریابی می‌کند. الگوریتم‌های قابل‌پلاگ (کمترین درخواست، کمترین تأخیر، KV cache-aware، prefix-cache-aware، LoRA affinity و fairness scheduling) پشتیبانی می‌شوند. قابلیت LoRA hot-swapping امکان تغییر و مسیریابی بدون اختلال را فراهم می‌آورد. همچنین سیاست‌هایی مانند canary release، token-level rate limiting و failover را فراهم می‌کند. با مدیریت منطق مسیریابی به‌صورت بومی، نیاز به gateway جداگانه‌ای مثل Envoy کاهش می‌یابد.

4. مقیاس خودکار مبتنی بر هزینه

مقیاس‌گذاری همگن بر اساس معیارهای تجاری (CPU/GPU/Memory/Custom) و بهینه‌سازی ناهمگن برای تخصیص شتاب‌دهنده‌ها بر پایه نسبت cost-to-performance انجام می‌شود.

5. پشتیبانی گسترده از سخت‌افزار و موتورهای استنتاج

Inference engines مثل vLLM، SGLang، Triton/TGI و دیگران از طریق یک API انتزاعی پشتیبانی می‌شوند. مدیریت محاسبات ناهمگن امکان ترکیب GPU و NPU را برای هم‌ترازی هزینه و SLO فراهم می‌کند.

6. کنترل جریان داخلی و زمان‌بندی منصفانه

ترافیک را بر اساس سابقه مصرف اولویت‌بندی می‌کند تا از گرسنگی کاربران با اولویت پایین جلوگیری شود. کنترل جریان امکان تعیین محدودیت‌های ریزدانه بر اساس کاربر، مدل و طول توکن را می‌دهد.

عملکرد

در سناریوهایی با درخواست‌های طولانی (مثلاً 4096 توکن)، استراتژی «KV-cache-aware + least-request» Kthena نسبت به یک خط مبنا به دستاوردهای قابل‌توجهی می‌رسد: افزایش توان عملیاتی حدود 2.73 برابر، کاهش TTFT و افت تأخیر تا کمتر از 60٪ در برخی تنظیمات مشاهده شده است. برای بارهای مکالمه‌ای و سنگین، awareness از KV cache مزایای تعیین‌کننده‌ای دارد.

حمایت جامعه و صنعت

Kthena از زمان آغاز توجه و حمایت بازیگران صنعت را جلب کرده است. حمایت‌کنندگان رسمی و نظرات آن‌ها شامل موارد زیر است:

— Xiaobo Qi، مدیر خدمات محاسباتی عمومی، Huawei Cloud: Kthena پتانسیل بهره‌برداری از محاسبات متنوع از جمله Ascend را نشان می‌دهد و دریچه‌ای برای همکاری با توسعه‌دهندگان جهانی جهت ایجاد اکوسیستمی باز و پررونق فراهم می‌کند. 🌐

— لی یانگ، مدیر R&D PaaS، China Telecom AI: Kthena با ترکیب زمان‌بندی یکپارچه و ادغام منابع Volcano، تخصیص دینامیک منابع را ممکن ساخته و می‌تواند استفاده از منابع را به سطوح بالاتری برساند.

— Paco Xu، سرپرست تیم منبع باز در DaoCloud: راه‌اندازی Kthena نقطه عطفی در گسترش قابلیت‌های واقعی Volcano برای مدل‌های عملی است و تیم‌ها را قادر می‌سازد با هزینه کمتر به زمان‌بندی هوشمندتر و بهره‌وری بالاتر دست پیدا کنند.

— Kong Gu (Huachang Chen)، Cloud Native Business Gateway Lead، Xiaohongshu: تیم Xiaohongshu با سازندگان Kthena برای طراحی استراتژی‌های زمان‌بندی هوشمند مانند micro-traffic scheduling و مدیریت API مدل همکاری کرده است.

— Zhaoxu Lu، سرپرست تیم، مرکز محاسبات هوشمند، China Unicom Cloud: China Unicom Cloud پس از ارزیابی، از طراحی آینده‌نگر Kthena و قابلیت‌های time-aware و topology-aware آن استقبال کرده است و آن را آماده تولید می‌داند.

— کوین وانگ، نگهدارنده Volcano و نایب‌رئیس CNCF TOC: راه‌اندازی Kthena نشان‌دهنده حرکت اکوسیستم Volcano به سمت AI-native در Kubernetes است و از تخصص G-scheme برای استنتاج LLM بهره می‌برد.

شروع کاوش در Kthena

این تازه آغاز راه است؛ توسعه‌دهندگان قصد دارند الگوریتم‌های زمان‌بندی کاراتر و بهترین روش‌های بیشتری برای استقرار مدل‌های بزرگ فراهم کنند. برای مشاهده کد و مشارکت:

https://github.com/volcano-sh/kthena 🔧