به گزارش از وبسایت cncf، گروه مشاوره فنی TAG Infrastructure مقاله جامع جدیدی را منتشر کرده است که به چالشهای استقرار بارهای کاری AI/ML در مقیاس روی Kubernetes میپردازد و راهکارهایی عملی برای مدیریت دادهها ارائه میدهد. 🚀
استقرار این بارهای کاری سنگین و سازگار کردن زیرساختهای بومی ابر، بهسرعت باعث ایجاد گلوگاههای قابل توجه در جریان داده میشود. حرکت مداوم حجمهای گسترده داده، بهویژه هنگام بهرهگیری از شتابدهندههایی مانند GPU، نیازمند بازطراحی معماریهای ذخیرهسازی سنتی است.
تیمهای زیرساخت در طول چرخه عمر داده با موانع متعددی روبهرو میشوند:
دام فایلهای کوچک: مجموعههای داده شامل میلیونها فایل کوچک بار زیادی بر metadata servers وارد میکنند.
تنگناهای جداشده: تفکیک فضاهای ذخیرهسازی مقیاسپذیر است اما میتواند سربار API و کاهش بهرهوری GPU را به همراه داشته باشد.
تغییر نمایههای بار کاری: آموزش دستهای با توان عملیاتی بالا نیازمند انتقال پایدار دادههاست، در حالی که استنتاج در تولید پروفایلهای تاخیر-حساس و درخواست-پاسخ را ایجاب میکند.
کاغذ سفید ستونهای فنی کلیدی اکوسیستم دادههای AI در ابر را به لایههای ساختاری تفکیک میکند و راهکارهای زیر را بررسی مینماید:
data lakehouses و vector databases: این راهنما ادغام سیستمهای متمرکز در lakehouseهای ترکیبی را با استفاده از فرمتهای باز مانند Parquet و Iceberg بررسی میکند و همچنین نقش vector databases مانند Milvus را در مدیریت embeddings برای جستجوهای مشابه و RAG تشریح میکند.
Caching & Data Locality: مقاله استراتژیهایی برای کمینهسازی تأخیر انتقال داده ارائه میدهد و پروژه CNCF Fluid را بهعنوان راهکاری برای همآهنگسازی ذخیرهسازی توزیعشده در Kubernetes برجسته میکند.
رابطهای استانداردشده (CSI & COSI): جامعه با استفاده از Container Storage Interface (CSI) برای بلوک/فایل، COSI برای ذخیرهسازی اشیاء و درایورهای FUSE CSI بومی ابری، لایههای مختلف ذخیرهسازی را به هم پیوند میزند.
خطوط لوله دادههای مدرن: مقاله مسیرهای مهاجرت از پردازش دستهای سنتی به جریانهای بلادرنگ را با تکیه بر Change Data Capture (CDC) و پلتفرمهای پخش رویداد مانند Apache Kafka ترسیم میکند.
نمایههای ذخیرهسازی در طول چرخه عمر AI: یکی از نکات برجسته کاغذ سفید، تفکیک نیازهای ذخیرهسازی در سه مرحله مجزا است:
1. آموزش مدل: فاز طولانیمدت با تمرکز بر حداکثرسازی بهرهوری GPU. Storage باید از دسترسی غیرتوالیپذیر پشتیبانی کند، تحمل الگوهای تصادفی خواندن/نوشتن را داشته باشد و هنگام checkpointing از نوشتن همگام حجیم جان سالم به در ببرد.
2. استنتاج: فاز حساس به تأخیر که با ترافیک پراکنده و نیاز به بارگذاری سریع مدلها مشخص میشود. سیستمهای تولیدی اغلب به معماریهای حافظهای پیشرفته مانند KV Caching و Prefix Caching برای حذف محاسبات اضافی متکیاند.
3. AI agents: عوامل هوش مصنوعی معماری استدلال حلقهبسته و تکراری را معرفی میکنند و نیاز به حافظههای کوتاهمدت برای وضعیت و تاریخچه، مخازن موقتی برای واسطهای میانی یا رسانهها و حافظه بلندمدت برای ترکیب جلسات گذشته دارند.
با ما همراه شوید! جامعه TAG Infrastructure نظرات و تجربیات شما را میپذیرد تا الگوهای معماری عملی و پایدار برای بارهای کاری بومی ابر شکل گیرد. مطالعه کامل white paper را توصیه میکنیم و از شما دعوت میکنیم با بررسی منشور TAG Infrastructure مشارکت کنید. 🔍
به گفتگو در کانال #tag-infrastructure در فضای کاری CNCF Slack بپیوندید! 🙂