امروز خوشحالیم اعلام کنیم اعضای کلیدی تیم Ensemble AI به Cloudflare ملحق میشوند تا کار روی زیرساختهای AI را سرعت ببخشند و اجرای مدلهای قدرتمند AI را برای توسعهدهندگان در مقیاس بزرگ، کارا و اقتصادیتر کنند 🚀
Ensemble AI که در سال 2023 در سانفرانسیسکو تأسیس شد، روی یکی از مهمترین چالشهای حوزه AI کار کرده: کوچکتر، سریعتر و ارزانتر کردن مدلهای بزرگ بدون قربانی کردن کیفیت. آنها روشهایی در حوزه model compression و efficient inference توسعه دادهاند که هدفشان کاهش حافظه، محاسبات و سربار استقرار برای large language models و معماریهای multimodal است.
وقتی AI تبدیل به پایهای از معماری اپلیکیشنها میشود، اقتصاد inference دیگر جنبهای فرعی نیست؛ مدلها بزرگتر میشوند، بارکاریها پویاتر هستند و مشتریان انتظار دارند AI همهجا در دسترس، سریع، قابلاطمینان و مقرونبهصرفه باشد. پیوستن تیم Ensemble به Cloudflare توانایی ما را برای تحقق این انتظارات تقویت میکند 🧠
تیم Ensemble تمرکزش را روی حفظ ساختار درون مدلهای مدرن گذاشته است و بهجای اینکه فقط به quantization یا محدودیتهای سختافزاری بسنده کند، بلوکهای معماری جدیدی طراحی کرده که شبکههای عصبی را در سطح معماری فشردهتر و کاراتر میکنند. این نگرش کمک میکند تا ساختارهای معنیدار مدل—مثل heads، channels یا ابعاد فضایی—حفظ شوند و در عین حال پارامترها و محاسبات کاهش یابند.
یکی از اجزای کلیدی کار آنها NdLinear است؛ یک جایگزین drop-in برای لایههای خطی استاندارد در transformerها که بهجای تختسازی (flattening) روی فعالسازیهای چندبعدی کار میکند. این اجازه میدهد مقادیر معنایی در ابعاد مختلف حفظ شوند و همزمان تعداد پارامتر و بار محاسباتی کم شود. همچنین NdLinear-LoRA بهعنوان یک روش adaptation کارا معرفی شده تا پارامترهای trainable مورد نیاز برای fine-tuning مدلهای بزرگ را کاهش دهد. از دید DevOps/SRE این یعنی مصرف کمتر حافظه GPU، امکان pack بهتر batchها و کاهش هزینههای زیرساختی برای استقرار و مقیاسدهی ⚙️
این رویکردها مکمل تکنیکهای دیگر مثل quantization و vector quantization هستند. ترکیب این راهکارها به سمت آیندهای حرکت میکند که توسعهدهندگان بتوانند مدلهای توانمند را با نیازهای حافظه، محاسبات و هزینه بهطور قابلتوجهی پایینتر اجرا کنند.
Cloudflare Workers AI به توسعهدهندگان دسترسی به inference سرورلس با پشتیبانی GPU روی شبکه جهانی Cloudflare را میدهد. وقتی اپلیکیشنها بیش از پیش AI-native میشوند، توانایی سرو کردن مدلها بهصورت مؤثر یکی از مولفههای حیاتی پلتفرم است. هزینه inference یکی از بزرگترین موانع مقیاسپذیری است: هر بهبودی در اندازه مدل، حافظه مصرفی، throughput یا GPU utilization باعث میشود AI برای توسعهدهندگان در دسترستر و برای مشتریان اقتصادیتر شود. این موضوع خصوصاً وقتهایی اهمیت دارد که بارهای کاری از تولید متن ساده فراتر بروند و شامل agents، multimodal models، personalization، fine-tuning، retrieval و reinforcement learning شوند.
ما روی قابلیتهای اصلی ماشین لرنینگ سرمایهگذاریمان را عمیقتر میکنیم تا Workers AI سریعتر، انعطافپذیرتر و کمهزینهتر شود. این کار بر پایه تلاشهای قبلی ما مانند inference engine یعنی Infire، تکنیکهای tensor compression مثل Unweight و پلتفرم اجرای extra large language models ساخته میشود. تمرکز تیم بر بهبود اقتصاد سرو مدلهای بزرگ و معماریهای پیشرفته AI است؛ با تأکید ویژه روی model efficiency، GPU utilization و scalable deployment — از جمله بهینهسازی packing، batching، و placement برای کاهش latency و هزینهها.
زیرساخت AI وارد فاز جدیدی شده است: توسعهدهندگان دیگر صرفاً به دسترسی مدلها نیاز ندارند؛ آنها به زیرساختی نیاز دارند که مدلها را قابلاعتماد، مقرونبهصرفه و نزدیک به کاربر اجرا کند. همچنین باید بدون قفل شدن توسط هزینه یا پیچیدگیهای عملیاتی، امکان آزمایش با اندازههای مختلف مدل، روشهای fine-tuning و الگوهای استقرار را داشته باشند. شبکه جهانی، پلتفرم توسعهدهنده و معماری serverless ما پایهای است که میتوانیم AI را بهجایی نزدیک کنیم که اپلیکیشنها از قبل اجرا میشوند؛ و Workers AI Machine Learning Engineering team روی بهبود لایه کارایی زیر این تجربه کار خواهد کرد.
با ترکیب زیرساخت جهانی Cloudflare و کارها و تحقیقات Ensemble در model compression و معماریهای کارا، میتوانیم پلتفرمی بسازیم که توسعهدهندگان با هزینه کمتر، عملکرد بهتر و سربار عملیاتی کمتر، اپلیکیشنهای AI را مستقر کنند.
قدم بعدی ساده است: ادامه ساختن زیرساختی که AI را برای توسعهدهندگان در سراسر جهان کاراتر، در دسترستر و مفیدتر کند. هدف ما این است که به توسعهدهندگان کمک کنیم بارهای کاری قدرتمند AI را در مقیاس جهانی اجرا کنند و همزمان اقتصاد inference را در سراسر پلتفرم Cloudflare بهبود دهیم. اگر میخواهید در این مأموریت همراه ما باشید، به صفحه فرصتهای شغلی ما سر بزنید 🙌