امروز خوشحالیم اعلام کنیم اعضای کلیدی تیم Ensemble AI به Cloudflare ملحق می‌شوند تا کار روی زیرساخت‌های AI را سرعت ببخشند و اجرای مدل‌های قدرتمند AI را برای توسعه‌دهندگان در مقیاس بزرگ، کارا و اقتصادی‌تر کنند 🚀

Ensemble AI که در سال 2023 در سان‌فرانسیسکو تأسیس شد، روی یکی از مهم‌ترین چالش‌های حوزه AI کار کرده: کوچک‌تر، سریع‌تر و ارزان‌تر کردن مدل‌های بزرگ بدون قربانی کردن کیفیت. آن‌ها روش‌هایی در حوزه model compression و efficient inference توسعه داده‌اند که هدف‌شان کاهش حافظه، محاسبات و سربار استقرار برای large language models و معماری‌های multimodal است.

وقتی AI تبدیل به پایه‌ای از معماری اپلیکیشن‌ها می‌شود، اقتصاد inference دیگر جنبه‌ای فرعی نیست؛ مدل‌ها بزرگ‌تر می‌شوند، بارکاری‌ها پویا‌تر هستند و مشتریان انتظار دارند AI همه‌جا در دسترس، سریع، قابل‌اطمینان و مقرون‌به‌صرفه باشد. پیوستن تیم Ensemble به Cloudflare توانایی ما را برای تحقق این انتظارات تقویت می‌کند 🧠

تیم Ensemble تمرکزش را روی حفظ ساختار درون مدل‌های مدرن گذاشته است و به‌جای اینکه فقط به quantization یا محدودیت‌های سخت‌افزاری بسنده کند، بلوک‌های معماری جدیدی طراحی کرده که شبکه‌های عصبی را در سطح معماری فشرده‌تر و کاراتر می‌کنند. این نگرش کمک می‌کند تا ساختارهای معنی‌دار مدل—مثل heads، channels یا ابعاد فضایی—حفظ شوند و در عین حال پارامترها و محاسبات کاهش یابند.

یکی از اجزای کلیدی کار آن‌ها NdLinear است؛ یک جایگزین drop-in برای لایه‌های خطی استاندارد در transformerها که به‌جای تخت‌سازی (flattening) روی فعال‌سازی‌های چندبعدی کار می‌کند. این اجازه می‌دهد مقادیر معنایی در ابعاد مختلف حفظ شوند و هم‌زمان تعداد پارامتر و بار محاسباتی کم شود. همچنین NdLinear-LoRA به‌عنوان یک روش adaptation کارا معرفی شده تا پارامترهای trainable مورد نیاز برای fine-tuning مدل‌های بزرگ را کاهش دهد. از دید DevOps/SRE این یعنی مصرف کمتر حافظه GPU، امکان pack بهتر batchها و کاهش هزینه‌های زیرساختی برای استقرار و مقیاس‌دهی ⚙️

این رویکردها مکمل تکنیک‌های دیگر مثل quantization و vector quantization هستند. ترکیب این راهکارها به سمت آینده‌ای حرکت می‌کند که توسعه‌دهندگان بتوانند مدل‌های توانمند را با نیازهای حافظه، محاسبات و هزینه به‌طور قابل‌توجهی پایین‌تر اجرا کنند.

Cloudflare Workers AI به توسعه‌دهندگان دسترسی به inference سرورلس با پشتیبانی GPU روی شبکه جهانی Cloudflare را می‌دهد. وقتی اپلیکیشن‌ها بیش از پیش AI-native می‌شوند، توانایی سرو کردن مدل‌ها به‌صورت مؤثر یکی از مولفه‌های حیاتی پلتفرم است. هزینه inference یکی از بزرگ‌ترین موانع مقیاس‌پذیری است: هر بهبودی در اندازه مدل، حافظه مصرفی، throughput یا GPU utilization باعث می‌شود AI برای توسعه‌دهندگان در دسترس‌تر و برای مشتریان اقتصادی‌تر شود. این موضوع خصوصاً وقت‌هایی اهمیت دارد که بارهای کاری از تولید متن ساده فراتر بروند و شامل agents، multimodal models، personalization، fine-tuning، retrieval و reinforcement learning شوند.

ما روی قابلیت‌های اصلی ماشین لرنینگ سرمایه‌گذاری‌مان را عمیق‌تر می‌کنیم تا Workers AI سریع‌تر، انعطاف‌پذیرتر و کم‌هزینه‌تر شود. این کار بر پایه تلاش‌های قبلی ما مانند inference engine یعنی Infire، تکنیک‌های tensor compression مثل Unweight و پلتفرم اجرای extra large language models ساخته می‌شود. تمرکز تیم بر بهبود اقتصاد سرو مدل‌های بزرگ و معماری‌های پیشرفته AI است؛ با تأکید ویژه روی model efficiency، GPU utilization و scalable deployment — از جمله بهینه‌سازی packing، batching، و placement برای کاهش latency و هزینه‌ها.

زیرساخت AI وارد فاز جدیدی شده است: توسعه‌دهندگان دیگر صرفاً به دسترسی مدل‌ها نیاز ندارند؛ آن‌ها به زیرساختی نیاز دارند که مدل‌ها را قابل‌اعتماد، مقرون‌به‌صرفه و نزدیک به کاربر اجرا کند. همچنین باید بدون قفل شدن توسط هزینه یا پیچیدگی‌های عملیاتی، امکان آزمایش با اندازه‌های مختلف مدل، روش‌های fine-tuning و الگوهای استقرار را داشته باشند. شبکه جهانی، پلتفرم توسعه‌دهنده و معماری serverless ما پایه‌ای است که می‌توانیم AI را به‌جایی نزدیک کنیم که اپلیکیشن‌ها از قبل اجرا می‌شوند؛ و Workers AI Machine Learning Engineering team روی بهبود لایه کارایی زیر این تجربه کار خواهد کرد.

با ترکیب زیرساخت جهانی Cloudflare و کارها و تحقیقات Ensemble در model compression و معماری‌های کارا، می‌توانیم پلتفرمی بسازیم که توسعه‌دهندگان با هزینه کمتر، عملکرد بهتر و سربار عملیاتی کمتر، اپلیکیشن‌های AI را مستقر کنند.

قدم بعدی ساده است: ادامه ساختن زیرساختی که AI را برای توسعه‌دهندگان در سراسر جهان کاراتر، در دسترس‌تر و مفیدتر کند. هدف ما این است که به توسعه‌دهندگان کمک کنیم بارهای کاری قدرتمند AI را در مقیاس جهانی اجرا کنند و هم‌زمان اقتصاد inference را در سراسر پلتفرم Cloudflare بهبود دهیم. اگر می‌خواهید در این مأموریت همراه ما باشید، به صفحه فرصت‌های شغلی ما سر بزنید 🙌