به گزارش از وبسایت redhat
شرکتها حجم زیادی از اطلاعات بدون ساختار تولید میکنند؛ از اسناد و خطمشیها و فایلهای PDF گرفته تا ویکیها، پایگاههای دانش، دستورالعملهای منابع انسانی، اسناد حقوقی، کتابچههای راهنمای سیستم و نمودارهای معماری. وقتی کارمندان برای یافتن پاسخهای سریع و صحیح دچار مشکل میشوند، بهرهوری کاهش مییابد و دانش غیرمستند به گلوگاهی تبدیل میشود 🙂.
نسل افزوده با بازیابی (RAG) این چالش را با مشخص کردن پاسخهای LLM بر پایه دانش شرکت برطرف میکند. بهجای تکیه صرف بر حافظه مدل یا خروجیهای توهمزای آن، RAG قطعات مرتبط از اسناد را از یک پایگاه داده برداری بازیابی میکند و آنها را هنگام استنتاج در اختیار مدل قرار میدهد تا پاسخها دقیقتر و مستندتر شوند.
این QuickStart پیشروی RAG یک راهنمای عملی برای استقرار یک برنامه RAG سازمانی روی Red Hat OpenShift AI ارائه میدهد؛ سیستمی که استنتاج با کارایی بالا، نردههای حفاظتی ایمنی و خطوط لوله خودکار انتقال داده را شامل میشود. نمونههای QuickStart فناوری Red Hat را به ارزش تجاری پیوند میدهند و میتوانید همین امروز آنها را در کاتالوگ QuickStart امتحان کنید.
RAG چیست؟ RAG یک الگوی معماری است که خروجی یک LLM را با ارجاع به یک منبع دانش معتبر بیرونی ارتقاء میدهد. بدین ترتیب، LLM با استفاده از زمینه (context) غنیشده پاسخهایی دقیق و کمخطا تولید میکند.
تفاوت در سطح سازمانی: یک پیادهسازی Proof-of-Conceptِ ساده ممکن است کار کند، اما استقرار RAG در مقیاس سازمانی نیازمند معماریی است که قابل انعطاف، قابل تطبیق و قابل مدیریت باشد. این نیازها شامل موارد زیر است: امنیت و ایمنی (نردههای حفاظتی برای جلوگیری از خروجیهای مضر و حفاظت از دادههای حساس)، مقیاسپذیری (توانایی مدیریت هزاران سند و کاربر همزمان)، حاکمیت (ردیابی و مدیریت چرخه دادهها از منابعی مانند Amazon S3 یا Git تا پایگاههای برداری) و پشتیبانی از چند-اجاره (multitenancy) تا پایگاههای دانش برای بخشهای مختلف جدا نگه داشته شوند.
این QuickStart اجزای حیاتی مانند سرویسدهی مدل، پایگاههای داده برداری و خطوط لوله جذب (ingestion) را اتومات میکند و زیرساخت را روی Red Hat OpenShift AI پیادهسازی میکند. برای Serving مدل و مدیریت ایمنی از CRDهای سفارشی ServingRuntime و InferenceService استفاده میشود که ارائه سرویس با مقیاس و نظارت خودکار را ممکن میسازند و نقاط پایانی استاندارد Kubernetes و سازگار با GPU را فراهم میکنند.
در پیادهسازی QuickStart دو مدل به کار گرفته میشوند: یک LLM اصلی و یک مدل حفاظتی مانند Llama Guard. در کنسول OpenShift در فضای نام مربوطه دو پاد در حال اجرا خواهید دید: مدل اصلی و سپر ایمنی. تمام درخواستها از مسیر سپر عبور میکنند تا تطابق سازمانی تضمین شود.
سرور Llama Stack بهعنوان یک پلتفرم یکپارچه، منعطف و متنباز برای ساخت برنامههای هوش مصنوعی مستقر میشود؛ این سرور قابلیت حمل بین محیطها را فراهم میکند و از قفل شدن در فروشنده جلوگیری میکند. Llama Stack امکانات سازمانی مانند نردههای ایمنی، تلهمتری، ابزارهای ارزیابی و هماهنگی نمایندگی را عرضه میکند تا پیادهسازی یک سامانه AI آماده تولید سادهتر شود 😊.
برای ذخیرهسازی برداری سازمانی از ترکیب PGVector و Minio استفاده میشود: Minio بهعنوان یک ذخیرهساز محلی سازگار با S3 برای مرحلهبندی اسناد خام عمل کرده و PGVector بهعنوان پایگاهداده برداری با کارایی بالا برای نگهداری جاسازیها به کار میآید. این ترکیب امکان جداسازی دادهها را فراهم میکند؛ مثلاً درخواستی از بخش منابع انسانی تنها اسناد مرتبط با HR را بازیابی میکند و از نشت داده جلوگیری میشود.
خطوط لوله Kubeflow وظیفه خودکارسازی گردش کار جذب را برعهده دارند؛ پردازش اسناد از منابع مختلف به جاسازیهای برداری تبدیل شده و در PGVector ذخیره میشوند. در رابط چت نیز امکان Bring Your Own Document (BYOD) وجود دارد تا کاربران برای آزمایش فوری فایل آپلود کنند. برای آزمون منطق جذب، یک Jupyter Notebook از پیشپیکربندیشده (Data Science Workbench) ارائه شده است که خط لوله Kubeflow را راهاندازی میکند و اسناد را از یک سطل S3 واکشی و وارد PGVector مینماید.
حالتهای استقرار: QuickStart از دو استراتژی پشتیبانی میکند: استقرار روی OpenShift (برای محیط تولید یا توسعه سازمانی) یا اجرا بهصورت محلی (Local) با Docker/Podman. اجرای محلی برای توسعه مناسب است اما معمولاً به علت محدودیت VRAM و استفاده از CPU یا تراشههای M1/M2 نسبت به GPUهای سازمانی کندتر خواهد بود.
قبل از آغاز استقرار، موارد زیر را آماده کنید: خوشه Red Hat OpenShift پیکربندیشده (نسخهٔ توصیهشده +4.19)، منابع خوشهای کافی (GPU، رم، فضای دیسک)، دسترسی oc به CLI، نصب Helm، و کلیدها/توکنهای مورد نیاز مانند Hugging Face token و Websearch API key. همچنین دسترسی به مدلهای Meta Llama و Llama Guard لازم است.
نمونهای از دستورات و فایلهای پیکربندی که در این راهاندازی استفاده میشود:
git clone
oc login --token= --server=
oc get nodes -o jsonpath='{range .items[*]}{.metadata.name}{"n"}{end}'
NAMESPACE=rag LLM=llama-3-1-8b-instruct LLM_TOLERATION="nvidia.com/gpu"
نمودار Helm مربوط به RAG و وابستگیهای آن شامل اجزایی مانند pgvector، llm-service، configure-pipeline، ingestion-pipeline، llama-stack و mcp-servers است. نمونهای از بخش dependencies در Chart.yaml:
dependencies:
- name: pgvector
version: 0.5.1
repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
condition: pgvector.enabled
- name: llm-service
version: 0.5.2
repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
condition: llm-service.enabled
- name: configure-pipeline
version: 0.5.4
repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
condition: configure-pipeline.enabled
- name: ingestion-pipeline
version: 0.5.1
repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
condition: ingestion-pipeline.enabled
- name: llama-stack
version: 0.5.2
repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
condition: llama-stack.enabled
- name: mcp-servers
version: 0.5.7
repository: https://rh-ai-quickstart.github.io/ai-architecture-charts
condition: mcp-servers.enabled
پس از نصب، اجزای کلیدی مانند پایگاهداده PGVector، سرورهای مدل در OpenShift AI، خطوط لوله جذب، رابط چت و Workbench (Jupyter Notebook) فراهم میشوند. وضعیت پادها را در کنسول OpenShift در بخش Workloads → Pods در فضای نام rag بررسی کنید تا اطمینان حاصل شود که همه در وضعیت Running یا Completed هستند.
برای راهاندازی خطوط لوله به مسیر Red Hat OpenShift AI → Data Science Pipelines → Runs (پروژه: rag) بروید و اجرای pipelineها را مشاهده کنید. نوتبوک rag-pipeline را از Data Science Projects اجرا کنید تا منطق جذب را راهاندازی و اسناد را وارد PGVector نمایید.
تأیید نهایی شامل بررسی استقرار مدلها در Models → Model Deployments (پروژه: rag)، دسترسی به رابط چت از طریق Networking → Routes → rag و ارسال پرسشهایی برای آزمایش بازیابی و تولید پاسخهای مستند توسط سیستم RAG است. پس از این مراحل، میتوانید عملکرد مستقیم و عاملی RAG را آزمایش کنید و آن را برای نیازهای داخلی سازمان تنظیم و بهینه نمایید.