به گزارش از وبسایت cncf

اگر تا به حال حادثه‌ای در محیط تولید را اشکال‌زدایی کرده‌اید، می‌دانید که دشوارترین بخش اغلب رفع مشکل نیست؛ بلکه پیدا کردن نقطه آغاز است. بسیاری از مهندسان ساعت‌ها را صرف جمع‌آوری سرنخ‌ها، مقابله با فشار زمان و درک داده‌های پراکنده می‌کنند. 😓

معمولاً با یکی یا چند چالش زیر روبه‌رو می‌شوید:

• دانش نانوشته و فقدان زمینه: ممکن است با سرویسی مواجه شوید که خیلی خوب آن را نمی‌شناسید؛ مالکیت تیم تغییر کرده، مستندات ناقص است یا «کتاب راهنما» قدیمی یا مفقود شده است. در ۳۰ دقیقه اول اغلب به دنبال شخصی می‌گردید که قبلاً این مشکل را دیده باشد — و شاید این بار مشکل تازه باشد. 🧩

• بار ابزارها و جابجایی زمینه: پنل‌های کاری شما شبیه داشبورد کنترل ترافیک هوایی شده‌اند. بین Grafana و Application Insights جابجا می‌شوید، لاگ‌های کانتینر را بررسی می‌کنید، ردیابی‌ها را دنبال می‌کنید و در عین حال از شما ETA می‌خواهند. تبادل داده‌ها بین ابزارها اغلب دستی، کند و خسته‌کننده است. ⏳

• پیچیدگی و شکاف‌های دانش: سیستم‌های ابری مدرن مثل Kubernetes قدرتمند اما پیچیده‌اند؛ هر لایه — نودها، پادها، کنترل‌کننده‌ها، APIها، شبکه و autoscalers — حالت‌های خرابی خاص خود را دارد. تشخیص درست نیازمند تخصص در چند حوزه است که حتی برای مهندسان باتجربه هم همیشه مهیا نیست. 🔍

برای حل این چالش‌ها به راه‌حلی نیاز است که بتواند سیگنال‌ها را فیلتر کند، الگوهای حادثه‌های گذشته را به‌خاطر بسپارد و شما را به سمت محتمل‌ترین علت هدایت کند. اینجا HolmesGPT، یک پروژه CNCF Sandbox، وارد عمل می‌شود. 🚀

HolmesGPT در اکتبر 2025 به عنوان پروژه‌ای در CNCF Sandbox پذیرفته شد. هدف آن ساده‌سازی آشفتگی‌های فرایند اشکال‌زدایی در محیط تولید است: گردآوری لاگ‌ها، متریک‌ها و tracingها از منابع مختلف، استدلال روی آنها و ارائه نتایج واضح و مبتنی بر داده به زبان ساده.

HolmesGPT چیست؟

HolmesGPT یک عامل (agent) عیب‌یابی AI متن‌باز است که برای Kubernetes و محیط‌های native cloud طراحی شده است. این پروژه تله‌متری مشاهده‌پذیری، reasoning بر پایه LLM و runbookهای ساختارمند را ترکیب می‌کند تا تحلیل ریشه‌ای علت (RCA) را تسریع کرده و اقدامات پیشنهادی را ارائه دهد.

برخلاف داشبوردهای استاتیک یا چت‌بات‌های ساده، HolmesGPT یک agent فعال است: به‌طور هوشمند تصمیم می‌گیرد چه داده‌هایی را واکشی کند، پرس‌وجوهای هدفمند اجرا می‌کند و فرضیه‌های خود را مکرراً بازبینی می‌کند — در حالی که در محیط شما باقی می‌ماند و عمل می‌کند. 🤖

مزایای کلیدی:

• حلقه کنترلی بومی مبتنی بر AI: HolmesGPT از الگوی task-list عاملی استفاده می‌کند.
• معماری باز: هر ادغام و مجموعه‌ابزاری قابل توسعه است و با runbookهای موجود و سرورهای MCP کار می‌کند.
• حفظ حریم خصوصی داده: مدل‌ها می‌توانند به‌صورت محلی، در خوشه شما یا در فضای ابری اجرا شوند.
• مبتنی بر جامعه: طراحی مبتنی بر اصول تعامل‌پذیری و شفافیت CNCF.

نحوه عملکرد — یک مثال عملی

وقتی HolmesGPT اجرا می‌شود ممکن است این سؤال را بپرسد: «چرا پاد من در حالت CrashLoopBackOff قرار گرفته است؟»

HolmesGPT این‌طور عمل می‌کند:
1) هدف را درک می‌کند → تشخیص می‌دهد که شما به دنبال علت راه‌اندازی مجدد پاد هستید.
2) یک فهرست کار می‌سازد → مشکل را به قطعات کوچک‌تر تقسیم کرده و هر کدام را جداگانه اجرا می‌کند.
3) Queries شبکه و رویدادها، لاگ‌ها و مشخصات پاد را جمع‌آوری می‌کند تا زمینهٔ مرتبط را بشناسد ← ممکن است تشخیص دهد که یک استقرار اخیر تصویر را به‌روزرسانی کرده است.
4) راه‌حل‌ها را توضیح می‌دهد و پیشنهاد می‌کند → گزارش‌هایی به زبان طبیعی برمی‌گرداند که گام‌های تشخیص و اصلاح را توضیح می‌دهد. ✅

معماری و توسعه‌پذیری

معماری HolmesGPT به‌صورت قابل توسعه طراحی شده و به مشارکت‌کنندگان اجازه می‌دهد جزئیات جدید اضافه کنند:

• Toolsets: ساخت دستورات سفارشی برای خطوط لوله مشاهده‌پذیری داخلی.
• Evals: افزودن معیارهای سفارشی برای دقت، هزینه یا latency مدل‌ها.
• Runbooks: کدنویسی بهترین شیوه‌ها (مثلاً «تشخیص خرابی‌های DNS» یا «اشکال‌زدایی تامین PVC») برای استفاده مجدد. ✍️

مثالی از یک ابزار سفارشی ساده:

holmes:
  toolsets:
    kubernetes/pod_status:
      توضیحات: "وضعیت یک Kubernetes pod را بررسی کنید."
      ابزارها:
        - نام: "get_pod"
          توضیحات: "واکشی جزئیات پاد از یک namespace."
          دستور: "kubectl get pod {{ pod }} -n {{ namespace }}"

شروع به کار و نصب HolmesGPT

برای نصب چند مسیر وجود دارد؛ یکی از ساده‌ترین راه‌ها استفاده از Homebrew است:

brew tap robusta-dev/homebrew-holmesgpt
brew install holmesgpt

راهنمای نصب کامل شامل دستورالعمل‌هایی برای helm، CLI و UI در دسترس است. پس از نصب، با تنظیم کلید API می‌توانید هر LLM سازگار (هر LLM compatible with OpenAI-like interfaces) را راه‌اندازی کنید — اغلب با تعیین متغیرهای محیطی راجع به ارائه‌دهنده مدل.

برای اجرا به‌صورت محلی می‌توانید نمونه‌ای مانند زیر را اجرا کنید:

هولمز می‌پرسد "مخاطب وارد کردن نمایه کاربر چیست؟" --model="anthropic/claude-sonnet-4-5"

ویژگی‌های بیشتر و منابع

• GitHub: https://github.com/robusta-dev/holmesgpt
• اسناد: holmesgpt.dev

چگونه مشارکت کنید 🤝

HolmesGPT کاملاً جامعه‌محور است و از مشارکت‌های جدید استقبال می‌کند: افزودن toolset برای ابزارهای مشاهده‌پذیری یا خطوط CI/CD، نوشتن runbookهای عملیاتی قابل استفاده مجدد، توسعه ارزیابی‌ها برای سنجش دقت reasoning مدل‌ها، نگارش مستندات و آموزش‌ها، ثبت خطاها و ایجاد دموها یا کمک به بازبینی‌ها. همچنین می‌توانید در مباحث مرتبط با حاکمیت و پیشرفت پروژه در انجمن CNCF مشارکت کنید. همه مشارکت‌ها باید از کد رفتاری CNCF پیروی کنند.

منابع تکمیلی

• مخزن GitHub پروژه
• در Slack CNCF به کانال #holmesgpt بپیوندید
• راهنمای مشارکت را مطالعه کنید