صورتحساب AI شما از کنترل خارج شده و ممکن است حسابها هر ماه شوکهتان کنند — اما راهحل فوری وجود دارد: Cloudflare میتواند کمک کند. 💸
تقریباً هیچ CIO یا CFOای در دنیا نیست که الان نگران هزینههای AI نباشد. شرکتها برای اجتناب از عقب ماندن کارکنان را تشویق کردهاند که تا جای ممکن از AI استفاده کنند — «Move fast, we’ll figure out the bill later.» نتیجه: تیمهایی که جدی وارد شدند به دستاوردهای واقعی رسیدند، اما هزینهها هم واقعی و چشمگیر هستند.
قصه تکراری است: یک API key مشترک برای همه مهندسان صادر میشود، مصرف ناگهان بالا میرود، و در پایان ماه مالی میپرسد پول کجا رفته. آیا ML تیم یک pipeline جدید آموزش داده؟ آیا یک اینترن برای پاکسازی ایمیل Claude Opus اجرا کرده؟ یا یک job در CI که در یک weekend دهها میلیون token سوزانده؟ چون API key هویت مصرفکننده را نشان نمیدهد، پاسخ معلوم نیست. 🤷♂️
وقتی بودجه، شفافیت و منطق مسیریابی مشخص نباشد، طبیعی است که افراد به قویترین مدل دست بزنند. اما بیشتر کارها نیازی به frontier models ندارند: خلاصهسازی کد با یک مدل ارزانتر کیفیت قابل قبول میدهد، در حالی که refactor بزرگ ممکن است به مدل پیشرفته نیاز داشته باشد. باید انتخاب ابزار مناسب ساده و دیدهبانی هزینهها آسان باشد.
بدون دیدِ روشن از مصرف، نمیتوانید ROI هزینههای AI را محاسبه یا محافظت کنید. درست مثل بقیه اقلام هزینهای کسبوکار، AI هم باید بودجه و نسبتبندی هزینه به تیم داشته باشد.
AI Gateway چیست؟ AI Gateway بین اپلیکیشنهای شما و AI providers قرار میگیرد. به جای اینکه مستقیم به OpenAI، Anthropic، Google یا هر ارائهدهنده دیگری زنگ بزنید، درخواستها اول از AI Gateway عبور میکنند. این کار فوراً ابزارهای مفیدی در اختیارتان میگذارد:
Unified billing برای جابجایی ساده بین providers و مدلها 🔁
Logging across all providers — هر درخواست، تعداد توکن و هزینهها در یکجا
Response caching برای کاهش هزینه و بهبود latency
Rate limiting و content guardrails و امکان بلاک کردن PII و secrets قبل از رسیدن به مدل 🔒
تا امروز، AI Gateway نمای کلی مصرف را نشان میداد اما پاسخ به «چه کسی چقدر خرج کرده» یا «چطور محدودش کنیم» آسان نبود. نمیتوانستید بگویید Jane در تیم engineering این ماه $2,000 روی Claude مصرف کرده و تیم data science تنها $400. امکان تعریف بودجههای تخصیصیافته به تیم یا نقش وجود نداشت — تا امروز.
محدودیتهای هزینه: بودجه برای مصرف AI
حالا AI Gateway از spend limits بهعنوان یک قابلیت پایه پشتیبانی میکند. این محدودیتها به شکل بودجه دلاری (نه توکنی) تعریف میشوند و مصرف تجمعی را روی همه درخواستها در زمان واقعی دنبال میکنند — مستقل از rate limiting سنتی. 🧾
میتوانید محدودیتها را بر اساس ترکیبی از بُعدها تعریف کنید: مدل، provider، یا صفات سفارشی که مدیر تعریف میکند مثل user، team یا application. پنجرهها میتوانند ثابت (مثلاً بازنشانی در روز اول ماه) یا rolling باشند و روزانه، هفتگی یا ماهانه تنظیم شوند. AI Gateway هزینه هر درخواست را بر اساس قیمتگذاری مدل محاسبه و مصرف را در برابر حد شما بهصورت real time پیگیری میکند. در analytics dashboard میتوانید فیلتر کنید و مصرف را بر اساس مدل، provider یا هر صفت دلخواه ببینید.
وقتی بودجه پر شد، گزینه دارید: بهصورت پیشفرض AI Gateway درخواستها را بلاک میکند، یا میتوانید با Dynamic Routes قواعدی تعریف کنید که بعد از رسیدن به حد، درخواستها را به یک fallback مدل ارزانتر ارجاع دهد تا کار تیمها بهکل قطع نشود. امکان ارسال alert هنگام رسیدن به محدودیت هم در دست توسعه است. 🚨
Spend limits هماکنون در open beta برای همه کاربران AI Gateway فعال است. تنظیم آنها از طریق gateway settings در dashboard یا از طریق API ممکن است.
ما خودمان این را استفاده میکنیم — تجربه عملی
در Cloudflare هزینه توکنها را رصد میکنیم: میلیونها درخواست و میلیاردها توکن در ماه از طریق AI Gateway عبور میکند. برای حل مشکل «چه کسی چه مصرفی دارد؟»، AI Gateway میتواند هویت را به هر درخواست اضافه کند. وقتی کارمند از طریق Cloudflare Access احراز هویت میشود، identity را از JSON Web Token (JWT) استخراج و بهعنوان metadata به درخواست AI Gateway میچسبانیم. این باعث میشود مصرف بهازای هر کاربر، شکستن مصرف بهازای تیمها و نسبتبندی هزینهها بهصورت سازمانی در یکجا قابل مشاهده باشد. 👥
بودجهها و سیاستهای مبتنی بر هویت (closed beta)
علاوه بر spend limits، امروز identity-driven budgets و policies بهصورت closed beta اعلام میشود. محدودیتهای معمول میتوانند بر اساس metadata کار کنند، اما اگر این metadata از سمت اپلیکیشن بیاید، قابلاعتماد نیست مگر اینکه هویت تأییدشده وجود داشته باشد.
در ترکیب با Cloudflare Access، AI Gateway میفهمد هر درخواست را چه کسی ارسال کرده — نه فقط حساب، بلکه کدام کارمند، کدام IdP group، یا کدام service. مثالهای عملی:
– بودجه per-user: مثلاً $500/ماه برای individual contributors و $2,000 برای senior engineers؛ وقتی فرد به حدش رسید، درخواستها یا به مدل ارزانتر downgrade میشوند یا مسدود میشوند.
– سیاستهای per-team: تیم ML به Claude Opus و GPT-4o دسترسی دارد، تیم برند به generative image و video models، و interns از open-source models روی Workers AI استفاده میکنند. این سیاستها دقیقاً به IdP groups موجود شما نگاشت میشوند.
برای CI/CD و autonomous agents، Access service tokens به هر agent هویت مشخص میدهد. مثلاً میتوانید ببینید code review bot این هفته 5 million tokens مصرف کرده و documentation generator تنها 500k. اگر یک agent خارج از کنترل مصرف میکند، میتوانید بدون تأثیرگذاری روی بقیه برایش سیاست بودجه اعمال کنید.
هر لاگ AI Gateway شامل هویت احرازشده میشود: ایمیل، IdP group، نام service token. اینها را به analytics platform خود export کنید و یک breakdown هزینه-به-ازای-کاربر-و-تیم خواهید داشت بدون اینکه چیزی از صفر بسازید.
از منظر فنی، شما یک Cloudflare Access application برای endpoint AI Gateway میسازید و براساس IdP groups سیاستها را پیکربندی میکنید. وقتی یک توسعهدهنده یا agent درخواست میفرستد، با OAuth و CLI device-code flow معمول احراز هویت میکند؛ AI Gateway توکن را اعتبارسنجی و هویت را استخراج میکند. نیازی به نوشتن Worker سفارشی، پارس کردن JWT بهصورت دستی یا تکیه بر metadataهای honor-system نیست.
ما این مدل را داخل خودمان پیاده کردیم و حالا در اختیار شما هم میگذاریم تا مجبور نباشید از صفر بسازید. اگر به closed beta علاقه دارید، میتوانید ثبتنام کنید تا دسترسی بگیرید.
بعدی چه خواهد بود: از کنترل هزینه به بهینهسازی هزینه
داشتن بودجه ضروری است، ولی سؤال بعدی این است که چگونه بیشترین بهره را از آن ببریم؟ همه درخواستها نیاز به frontier model ندارند. خلاصهسازی میتواند با مدل کوچکتر و ارزانتر انجام شود و اختلاف کیفیت قابلتوجهی نداشته باشد؛ در حالی که refactorهای بزرگ ممکن است نیاز به مدل پیشرفتهتر داشته باشند. بدون کنترل، اغلب افراد سراغ قویترین مدل میروند.
برای حل این مساله در حال توسعه قابلیت هوشمند مسیریابی task-based در AI Gateway هستیم. سیستم برای هر درخواست میتواند نوع کار را تحلیل و به مدلِ مناسبتری هدایت کند که بهترین نتیجه را با کمترین هزینه ارائه دهد. این ویژگی در حال توسعه فعال است — داکها و changelog را دنبال کنید. ⚙️
شروع کنید
راهاندازی AI Gateway رایگان است و spend limits همین حالا برای همه کاربران در دسترس است. اگر هنوز این کار را نکردهاید، یک gateway بسازید و اپلیکیشنها را به آن اشاره دهید. با یک limit بالا در حالت monitoring شروع کنید تا الگوهای مصرف فعلی را بهتر بفهمید قبل از اینکه اجرا را سختگیرانه کنید.
برای نسبتبندی per-user و سیاستهای تیمی، در closed beta برای identity-driven budgets ثبتنام کنید تا با ادغام Access راهاندازیتان را انجام دهیم. اگر میخواهید، میتوانیم درباره استراتژی امنیتی و مدیریت هزینه AI شما هم گفتگو کنیم — خوشحال میشویم تجربیات شما را بشنویم. 💬