صورتحساب AI شما از کنترل خارج شده و ممکن است حساب‌ها هر ماه شوکه‌تان کنند — اما راه‌حل فوری وجود دارد: Cloudflare می‌تواند کمک کند. 💸

تقریباً هیچ CIO یا CFOای در دنیا نیست که الان نگران هزینه‌های AI نباشد. شرکت‌ها برای اجتناب از عقب ماندن کارکنان را تشویق کرده‌اند که تا جای ممکن از AI استفاده کنند — «Move fast, we’ll figure out the bill later.» نتیجه: تیم‌هایی که جدی وارد شدند به دستاوردهای واقعی رسیدند، اما هزینه‌ها هم واقعی و چشمگیر هستند.

قصه تکراری است: یک API key مشترک برای همه مهندسان صادر می‌شود، مصرف ناگهان بالا می‌رود، و در پایان ماه مالی می‌پرسد پول کجا رفته. آیا ML تیم یک pipeline جدید آموزش داده؟ آیا یک اینترن برای پاک‌سازی ایمیل Claude Opus اجرا کرده؟ یا یک job در CI که در یک weekend ده‌ها میلیون token سوزانده؟ چون API key هویت مصرف‌کننده را نشان نمی‌دهد، پاسخ معلوم نیست. 🤷‍♂️

وقتی بودجه، شفافیت و منطق مسیریابی مشخص نباشد، طبیعی است که افراد به قوی‌ترین مدل دست بزنند. اما بیشتر کارها نیازی به frontier models ندارند: خلاصه‌سازی کد با یک مدل ارزان‌تر کیفیت قابل قبول می‌دهد، در حالی که refactor بزرگ ممکن است به مدل پیشرفته نیاز داشته باشد. باید انتخاب ابزار مناسب ساده و دیده‌بانی هزینه‌ها آسان باشد.

بدون دیدِ روشن از مصرف، نمی‌توانید ROI هزینه‌های AI را محاسبه یا محافظت کنید. درست مثل بقیه اقلام هزینه‌ای کسب‌وکار، AI هم باید بودجه و نسبت‌بندی هزینه به تیم داشته باشد.

AI Gateway چیست؟ AI Gateway بین اپلیکیشن‌های شما و AI providers قرار می‌گیرد. به جای اینکه مستقیم به OpenAI، Anthropic، Google یا هر ارائه‌دهنده دیگری زنگ بزنید، درخواست‌ها اول از AI Gateway عبور می‌کنند. این کار فوراً ابزارهای مفیدی در اختیارتان می‌گذارد:

Unified billing برای جابجایی ساده بین providers و مدل‌ها 🔁

Logging across all providers — هر درخواست، تعداد توکن و هزینه‌ها در یک‌جا

Response caching برای کاهش هزینه و بهبود latency

Rate limiting و content guardrails و امکان بلاک کردن PII و secrets قبل از رسیدن به مدل 🔒

تا امروز، AI Gateway نمای کلی مصرف را نشان می‌داد اما پاسخ به «چه کسی چقدر خرج کرده» یا «چطور محدودش کنیم» آسان نبود. نمی‌توانستید بگویید Jane در تیم engineering این ماه $2,000 روی Claude مصرف کرده و تیم data science تنها $400. امکان تعریف بودجه‌های تخصیص‌یافته به تیم یا نقش وجود نداشت — تا امروز.

محدودیت‌های هزینه: بودجه برای مصرف AI

حالا AI Gateway از spend limits به‌عنوان یک قابلیت پایه پشتیبانی می‌کند. این محدودیت‌ها به شکل بودجه دلاری (نه توکنی) تعریف می‌شوند و مصرف تجمعی را روی همه درخواست‌ها در زمان واقعی دنبال می‌کنند — مستقل از rate limiting سنتی. 🧾

می‌توانید محدودیت‌ها را بر اساس ترکیبی از بُعدها تعریف کنید: مدل، provider، یا صفات سفارشی که مدیر تعریف می‌کند مثل user، team یا application. پنجره‌ها می‌توانند ثابت (مثلاً بازنشانی در روز اول ماه) یا rolling باشند و روزانه، هفتگی یا ماهانه تنظیم شوند. AI Gateway هزینه هر درخواست را بر اساس قیمت‌گذاری مدل محاسبه و مصرف را در برابر حد شما به‌صورت real time پیگیری می‌کند. در analytics dashboard می‌توانید فیلتر کنید و مصرف را بر اساس مدل، provider یا هر صفت دلخواه ببینید.

وقتی بودجه پر شد، گزینه دارید: به‌صورت پیش‌فرض AI Gateway درخواست‌ها را بلاک می‌کند، یا می‌توانید با Dynamic Routes قواعدی تعریف کنید که بعد از رسیدن به حد، درخواست‌ها را به یک fallback مدل ارزان‌تر ارجاع دهد تا کار تیم‌ها به‌کل قطع نشود. امکان ارسال alert هنگام رسیدن به محدودیت هم در دست توسعه است. 🚨

Spend limits هم‌اکنون در open beta برای همه کاربران AI Gateway فعال است. تنظیم آن‌ها از طریق gateway settings در dashboard یا از طریق API ممکن است.

ما خودمان این را استفاده می‌کنیم — تجربه عملی

در Cloudflare هزینه توکن‌ها را رصد می‌کنیم: میلیون‌ها درخواست و میلیاردها توکن در ماه از طریق AI Gateway عبور می‌کند. برای حل مشکل «چه کسی چه مصرفی دارد؟»، AI Gateway می‌تواند هویت را به هر درخواست اضافه کند. وقتی کارمند از طریق Cloudflare Access احراز هویت می‌شود، identity را از JSON Web Token (JWT) استخراج و به‌عنوان metadata به درخواست AI Gateway می‌چسبانیم. این باعث می‌شود مصرف به‌ازای هر کاربر، شکستن مصرف به‌ازای تیم‌ها و نسبت‌بندی هزینه‌ها به‌صورت سازمانی در یک‌جا قابل مشاهده باشد. 👥

بودجه‌ها و سیاست‌های مبتنی بر هویت (closed beta)

علاوه بر spend limits، امروز identity-driven budgets و policies به‌صورت closed beta اعلام می‌شود. محدودیت‌های معمول می‌توانند بر اساس metadata کار کنند، اما اگر این metadata از سمت اپلیکیشن بیاید، قابل‌اعتماد نیست مگر اینکه هویت تأییدشده وجود داشته باشد.

در ترکیب با Cloudflare Access، AI Gateway می‌فهمد هر درخواست را چه کسی ارسال کرده — نه فقط حساب، بلکه کدام کارمند، کدام IdP group، یا کدام service. مثال‌های عملی:

– بودجه per-user: مثلاً $500/ماه برای individual contributors و $2,000 برای senior engineers؛ وقتی فرد به حدش رسید، درخواست‌ها یا به مدل ارزان‌تر downgrade می‌شوند یا مسدود می‌شوند.

– سیاست‌های per-team: تیم ML به Claude Opus و GPT-4o دسترسی دارد، تیم برند به generative image و video models، و interns از open-source models روی Workers AI استفاده می‌کنند. این سیاست‌ها دقیقاً به IdP groups موجود شما نگاشت می‌شوند.

برای CI/CD و autonomous agents، Access service tokens به هر agent هویت مشخص می‌دهد. مثلاً می‌توانید ببینید code review bot این هفته 5 million tokens مصرف کرده و documentation generator تنها 500k. اگر یک agent خارج از کنترل مصرف می‌کند، می‌توانید بدون تأثیرگذاری روی بقیه برایش سیاست بودجه اعمال کنید.

هر لاگ AI Gateway شامل هویت احرازشده می‌شود: ایمیل، IdP group، نام service token. این‌ها را به analytics platform خود export کنید و یک breakdown هزینه-به-ازای-کاربر-و-تیم خواهید داشت بدون اینکه چیزی از صفر بسازید.

از منظر فنی، شما یک Cloudflare Access application برای endpoint AI Gateway می‌سازید و براساس IdP groups سیاست‌ها را پیکربندی می‌کنید. وقتی یک توسعه‌دهنده یا agent درخواست می‌فرستد، با OAuth و CLI device-code flow معمول احراز هویت می‌کند؛ AI Gateway توکن را اعتبارسنجی و هویت را استخراج می‌کند. نیازی به نوشتن Worker سفارشی، پارس کردن JWT به‌صورت دستی یا تکیه بر metadataهای honor-system نیست.

ما این مدل را داخل خودمان پیاده کردیم و حالا در اختیار شما هم می‌گذاریم تا مجبور نباشید از صفر بسازید. اگر به closed beta علاقه دارید، می‌توانید ثبت‌نام کنید تا دسترسی بگیرید.

بعدی چه خواهد بود: از کنترل هزینه به بهینه‌سازی هزینه

داشتن بودجه ضروری است، ولی سؤال بعدی این است که چگونه بیشترین بهره را از آن ببریم؟ همه درخواست‌ها نیاز به frontier model ندارند. خلاصه‌سازی می‌تواند با مدل کوچک‌تر و ارزان‌تر انجام شود و اختلاف کیفیت قابل‌توجهی نداشته باشد؛ در حالی که refactorهای بزرگ ممکن است نیاز به مدل پیشرفته‌تر داشته باشند. بدون کنترل، اغلب افراد سراغ قوی‌ترین مدل می‌روند.

برای حل این مساله در حال توسعه قابلیت هوشمند مسیریابی task-based در AI Gateway هستیم. سیستم برای هر درخواست می‌تواند نوع کار را تحلیل و به مدلِ مناسب‌تری هدایت کند که بهترین نتیجه را با کمترین هزینه ارائه دهد. این ویژگی در حال توسعه فعال است — داک‌ها و changelog را دنبال کنید. ⚙️

شروع کنید

راه‌اندازی AI Gateway رایگان است و spend limits همین حالا برای همه کاربران در دسترس است. اگر هنوز این کار را نکرده‌اید، یک gateway بسازید و اپلیکیشن‌ها را به آن اشاره دهید. با یک limit بالا در حالت monitoring شروع کنید تا الگوهای مصرف فعلی را بهتر بفهمید قبل از اینکه اجرا را سخت‌گیرانه کنید.

برای نسبت‌بندی per-user و سیاست‌های تیمی، در closed beta برای identity-driven budgets ثبت‌نام کنید تا با ادغام Access راه‌اندازی‌تان را انجام دهیم. اگر می‌خواهید، می‌توانیم درباره استراتژی امنیتی و مدیریت هزینه AI شما هم گفتگو کنیم — خوشحال می‌شویم تجربیات شما را بشنویم. 💬