به گزارش از وبسایت cncf، گروه مشاوره فنی TAG Infrastructure مقاله جامع جدیدی را منتشر کرده است که به چالش‌های استقرار بارهای کاری AI/ML در مقیاس روی Kubernetes می‌پردازد و راهکارهایی عملی برای مدیریت داده‌ها ارائه می‌دهد. 🚀

استقرار این بارهای کاری سنگین و سازگار کردن زیرساخت‌های بومی ابر، به‌سرعت باعث ایجاد گلوگاه‌های قابل توجه در جریان داده می‌شود. حرکت مداوم حجم‌های گسترده داده، به‌ویژه هنگام بهره‌گیری از شتاب‌دهنده‌هایی مانند GPU، نیازمند بازطراحی معماری‌های ذخیره‌سازی سنتی است.

تیم‌های زیرساخت در طول چرخه عمر داده با موانع متعددی روبه‌رو می‌شوند:
دام فایل‌های کوچک: مجموعه‌های داده شامل میلیون‌ها فایل کوچک بار زیادی بر metadata servers وارد می‌کنند.
تنگناهای جداشده: تفکیک فضاهای ذخیره‌سازی مقیاس‌پذیر است اما می‌تواند سربار API و کاهش بهره‌وری GPU را به همراه داشته باشد.
تغییر نمایه‌های بار کاری: آموزش دسته‌ای با توان عملیاتی بالا نیازمند انتقال پایدار داده‌هاست، در حالی که استنتاج در تولید پروفایل‌های تاخیر-حساس و درخواست-پاسخ را ایجاب می‌کند.

کاغذ سفید ستون‌های فنی کلیدی اکوسیستم داده‌های AI در ابر را به لایه‌های ساختاری تفکیک می‌کند و راهکارهای زیر را بررسی می‌نماید:

data lakehouses و vector databases: این راهنما ادغام سیستم‌های متمرکز در lakehouseهای ترکیبی را با استفاده از فرمت‌های باز مانند Parquet و Iceberg بررسی می‌کند و همچنین نقش vector databases مانند Milvus را در مدیریت embeddings برای جستجوهای مشابه و RAG تشریح می‌کند.

Caching & Data Locality: مقاله استراتژی‌هایی برای کمینه‌سازی تأخیر انتقال داده ارائه می‌دهد و پروژه CNCF Fluid را به‌عنوان راهکاری برای هم‌آهنگ‌سازی ذخیره‌سازی توزیع‌شده در Kubernetes برجسته می‌کند.

رابط‌های استانداردشده (CSI & COSI): جامعه با استفاده از Container Storage Interface (CSI) برای بلوک/فایل، COSI برای ذخیره‌سازی اشیاء و درایورهای FUSE CSI بومی ابری، لایه‌های مختلف ذخیره‌سازی را به هم پیوند می‌زند.

خطوط لوله داده‌های مدرن: مقاله مسیرهای مهاجرت از پردازش دسته‌ای سنتی به جریان‌های بلادرنگ را با تکیه بر Change Data Capture (CDC) و پلتفرم‌های پخش رویداد مانند Apache Kafka ترسیم می‌کند.

نمایه‌های ذخیره‌سازی در طول چرخه عمر AI: یکی از نکات برجسته کاغذ سفید، تفکیک نیازهای ذخیره‌سازی در سه مرحله مجزا است:

1. آموزش مدل: فاز طولانی‌مدت با تمرکز بر حداکثرسازی بهره‌وری GPU. Storage باید از دسترسی غیرتوالی‌پذیر پشتیبانی کند، تحمل الگوهای تصادفی خواندن/نوشتن را داشته باشد و هنگام checkpointing از نوشتن همگام حجیم جان سالم به در ببرد.

2. استنتاج: فاز حساس به تأخیر که با ترافیک پراکنده و نیاز به بارگذاری سریع مدل‌ها مشخص می‌شود. سیستم‌های تولیدی اغلب به معماری‌های حافظه‌ای پیشرفته مانند KV Caching و Prefix Caching برای حذف محاسبات اضافی متکی‌اند.

3. AI agents: عوامل هوش مصنوعی معماری استدلال حلقه‌بسته و تکراری را معرفی می‌کنند و نیاز به حافظه‌های کوتاه‌مدت برای وضعیت و تاریخچه، مخازن موقتی برای واسط‌های میانی یا رسانه‌ها و حافظه بلندمدت برای ترکیب جلسات گذشته دارند.

با ما همراه شوید! جامعه TAG Infrastructure نظرات و تجربیات شما را می‌پذیرد تا الگوهای معماری عملی و پایدار برای بارهای کاری بومی ابر شکل گیرد. مطالعه کامل white paper را توصیه می‌کنیم و از شما دعوت می‌کنیم با بررسی منشور TAG Infrastructure مشارکت کنید. 🔍

به گفتگو در کانال #tag-infrastructure در فضای کاری CNCF Slack بپیوندید! 🙂