به گزارش از وبسایت redhat

شرکت‌ها حجم زیادی از اطلاعات بدون ساختار تولید می‌کنند؛ از اسناد و خط‌مشی‌ها و فایل‌های PDF گرفته تا ویکی‌ها، پایگاه‌های دانش، دستورالعمل‌های منابع انسانی، اسناد حقوقی، کتابچه‌های راهنمای سیستم و نمودارهای معماری. وقتی کارمندان برای یافتن پاسخ‌های سریع و صحیح دچار مشکل می‌شوند، بهره‌وری کاهش می‌یابد و دانش غیرمستند به گلوگاهی تبدیل می‌شود 🙂.

نسل افزوده با بازیابی (RAG) این چالش را با مشخص کردن پاسخ‌های LLM بر پایه دانش شرکت برطرف می‌کند. به‌جای تکیه صرف بر حافظه مدل یا خروجی‌های توهم‌زای آن، RAG قطعات مرتبط از اسناد را از یک پایگاه داده برداری بازیابی می‌کند و آنها را هنگام استنتاج در اختیار مدل قرار می‌دهد تا پاسخ‌ها دقیق‌تر و مستندتر شوند.

این QuickStart پیش‌روی RAG یک راهنمای عملی برای استقرار یک برنامه RAG سازمانی روی Red Hat OpenShift AI ارائه می‌دهد؛ سیستمی که استنتاج با کارایی بالا، نرده‌های حفاظتی ایمنی و خطوط لوله خودکار انتقال داده را شامل می‌شود. نمونه‌های QuickStart فناوری Red Hat را به ارزش تجاری پیوند می‌دهند و می‌توانید همین امروز آنها را در کاتالوگ QuickStart امتحان کنید.

RAG چیست؟ RAG یک الگوی معماری است که خروجی یک LLM را با ارجاع به یک منبع دانش معتبر بیرونی ارتقاء می‌دهد. بدین ترتیب، LLM با استفاده از زمینه (context) غنی‌شده پاسخ‌هایی دقیق و کم‌خطا تولید می‌کند.

تفاوت در سطح سازمانی: یک پیاده‌سازی Proof-of-Conceptِ ساده ممکن است کار کند، اما استقرار RAG در مقیاس سازمانی نیازمند معماریی است که قابل انعطاف، قابل تطبیق و قابل مدیریت باشد. این نیازها شامل موارد زیر است: امنیت و ایمنی (نرده‌های حفاظتی برای جلوگیری از خروجی‌های مضر و حفاظت از داده‌های حساس)، مقیاس‌پذیری (توانایی مدیریت هزاران سند و کاربر هم‌زمان)، حاکمیت (ردیابی و مدیریت چرخه داده‌ها از منابعی مانند Amazon S3 یا Git تا پایگاه‌های برداری) و پشتیبانی از چند-اجاره (multitenancy) تا پایگاه‌های دانش برای بخش‌های مختلف جدا نگه داشته شوند.

این QuickStart اجزای حیاتی مانند سرویس‌دهی مدل، پایگاه‌های داده برداری و خطوط لوله جذب (ingestion) را اتومات می‌کند و زیرساخت را روی Red Hat OpenShift AI پیاده‌سازی می‌کند. برای Serving مدل و مدیریت ایمنی از CRDهای سفارشی ServingRuntime و InferenceService استفاده می‌شود که ارائه سرویس با مقیاس و نظارت خودکار را ممکن می‌سازند و نقاط پایانی استاندارد Kubernetes و سازگار با GPU را فراهم می‌کنند.

در پیاده‌سازی QuickStart دو مدل به کار گرفته می‌شوند: یک LLM اصلی و یک مدل حفاظتی مانند Llama Guard. در کنسول OpenShift در فضای نام مربوطه دو پاد در حال اجرا خواهید دید: مدل اصلی و سپر ایمنی. تمام درخواست‌ها از مسیر سپر عبور می‌کنند تا تطابق سازمانی تضمین شود.

سرور Llama Stack به‌عنوان یک پلتفرم یکپارچه، منعطف و متن‌باز برای ساخت برنامه‌های هوش مصنوعی مستقر می‌شود؛ این سرور قابلیت حمل بین محیط‌ها را فراهم می‌کند و از قفل شدن در فروشنده جلوگیری می‌کند. Llama Stack امکانات سازمانی مانند نرده‌های ایمنی، تله‌متری، ابزارهای ارزیابی و هماهنگی نمایندگی را عرضه می‌کند تا پیاده‌سازی یک سامانه AI آماده تولید ساده‌تر شود 😊.

برای ذخیره‌سازی برداری سازمانی از ترکیب PGVector و Minio استفاده می‌شود: Minio به‌عنوان یک ذخیره‌ساز محلی سازگار با S3 برای مرحله‌بندی اسناد خام عمل کرده و PGVector به‌عنوان پایگاه‌داده برداری با کارایی بالا برای نگهداری جاسازی‌ها به کار می‌آید. این ترکیب امکان جداسازی داده‌ها را فراهم می‌کند؛ مثلاً درخواستی از بخش منابع انسانی تنها اسناد مرتبط با HR را بازیابی می‌کند و از نشت داده جلوگیری می‌شود.

خطوط لوله Kubeflow وظیفه خودکارسازی گردش کار جذب را برعهده دارند؛ پردازش اسناد از منابع مختلف به جاسازی‌های برداری تبدیل شده و در PGVector ذخیره می‌شوند. در رابط چت نیز امکان Bring Your Own Document (BYOD) وجود دارد تا کاربران برای آزمایش فوری فایل آپلود کنند. برای آزمون منطق جذب، یک Jupyter Notebook از پیش‌پیکربندی‌شده (Data Science Workbench) ارائه شده است که خط لوله Kubeflow را راه‌اندازی می‌کند و اسناد را از یک سطل S3 واکشی و وارد PGVector می‌نماید.

حالت‌های استقرار: QuickStart از دو استراتژی پشتیبانی می‌کند: استقرار روی OpenShift (برای محیط تولید یا توسعه سازمانی) یا اجرا به‌صورت محلی (Local) با Docker/Podman. اجرای محلی برای توسعه مناسب است اما معمولاً به علت محدودیت VRAM و استفاده از CPU یا تراشه‌های M1/M2 نسبت به GPUهای سازمانی کندتر خواهد بود.

قبل از آغاز استقرار، موارد زیر را آماده کنید: خوشه Red Hat OpenShift پیکربندی‌شده (نسخهٔ توصیه‌شده +4.19)، منابع خوشه‌ای کافی (GPU، رم، فضای دیسک)، دسترسی oc به CLI، نصب Helm، و کلیدها/توکن‌های مورد نیاز مانند Hugging Face token و Websearch API key. همچنین دسترسی به مدل‌های Meta Llama و Llama Guard لازم است.

نمونه‌ای از دستورات و فایل‌های پیکربندی که در این راه‌اندازی استفاده می‌شود:

git clone 

oc login --token= --server=

oc get nodes -o jsonpath='{range .items[*]}{.metadata.name}{"n"}{end}'

NAMESPACE=rag
LLM=llama-3-1-8b-instruct
LLM_TOLERATION="nvidia.com/gpu"

نمودار Helm مربوط به RAG و وابستگی‌های آن شامل اجزایی مانند pgvector، llm-service، configure-pipeline، ingestion-pipeline، llama-stack و mcp-servers است. نمونه‌ای از بخش dependencies در Chart.yaml:

dependencies:
  - name: pgvector
    version: 0.5.1
    repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
    condition: pgvector.enabled
  - name: llm-service
    version: 0.5.2
    repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
    condition: llm-service.enabled
  - name: configure-pipeline
    version: 0.5.4
    repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
    condition: configure-pipeline.enabled
  - name: ingestion-pipeline
    version: 0.5.1
    repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
    condition: ingestion-pipeline.enabled
  - name: llama-stack
    version: 0.5.2
    repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
    condition: llama-stack.enabled
  - name: mcp-servers
    version: 0.5.7
    repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
    condition: mcp-servers.enabled

پس از نصب، اجزای کلیدی مانند پایگاه‌داده PGVector، سرورهای مدل در OpenShift AI، خطوط لوله جذب، رابط چت و Workbench (Jupyter Notebook) فراهم می‌شوند. وضعیت پادها را در کنسول OpenShift در بخش Workloads → Pods در فضای نام rag بررسی کنید تا اطمینان حاصل شود که همه در وضعیت Running یا Completed هستند.

برای راه‌اندازی خطوط لوله به مسیر Red Hat OpenShift AI → Data Science Pipelines → Runs (پروژه: rag) بروید و اجرای pipelineها را مشاهده کنید. نوت‌بوک rag-pipeline را از Data Science Projects اجرا کنید تا منطق جذب را راه‌اندازی و اسناد را وارد PGVector نمایید.

تأیید نهایی شامل بررسی استقرار مدل‌ها در Models → Model Deployments (پروژه: rag)، دسترسی به رابط چت از طریق Networking → Routes → rag و ارسال پرسش‌هایی برای آزمایش بازیابی و تولید پاسخ‌های مستند توسط سیستم RAG است. پس از این مراحل، می‌توانید عملکرد مستقیم و عاملی RAG را آزمایش کنید و آن را برای نیازهای داخلی سازمان تنظیم و بهینه نمایید.