عنوان: Google’s AI advantage: چرا جداسازی crawler تنها راه رسیدن به اینترنتی منصفانه است
اوایل هفته، CMA از بستهای از الزامات رفتاری پیشنهادی برای Google مشورتگیری باز کرد. این سند از ذینفعان دعوت میکند تا قبل از تصویب نهایی نظرات خود را ارائه دهند. هدف اصلی قوانین پیشنهادی، مقابله با نبود انتخاب و شفافیت برای ناشران (هرکسی که محتوا را روی وب منتشر میکند) دربارهٔ نحوهٔ استفادهٔ Google از محتوای وب برای تقویت سرویسها و قابلیتهای generative AI است. 🌐
ما از اینکه CMA به نیاز ناشران به توافق منصفانهتر اذعان کرده استقبال میکنیم و معتقدیم این قواعد گامی در مسیر درستاند. ناشران باید ابزارهایی در اختیار داشته باشند که کنترل واقعی بر وارد شدن محتوایشان به سرویسهای generative AI را فراهم کند و شرکتهای فعال در حوزهٔ AI باید روی میدان بازی برابر رقابت کنند.
با این حال، به نظر میرسد CMA میتوانست قویتر عمل کند تا هم از بخش خلاقهٔ بریتانیا محافظت کند و هم رقابت سالمتری در بازارهای generative و agentic AI ترویج دهد.
تغییر مهم قانونی: در ژانویهٔ ۲۰۲۵ با اجرای Digital Markets, Competition and Consumers Act 2024 (DMCC) رویکرد رسیدگی به ریسکهای رقابتی تغییر کرد. بهجای تکیه صرف بر تحقیقات ضدانحصار، حالا CMA میتواند شرکتهایی را که قدرت بازار ریشهدار و چشمگیری دارند، بهعنوان دارای Strategic Market Status (SMS) تعیین کند و برایشان الزامات رفتاری خاص وضع نماید. این ابزار اجازهٔ مداخلات هدفمند در بازارهای دیجیتال را میدهد.
در اکتبر ۲۰۲۵، CMA گوگل را بهدلیل سهم حدود ۹۰٪ در جستوجوی بریتانیا، دارای SMS در حوزهٔ general search و search advertising شناخت. این تعیین شامل AI Overviews و AI Mode هم میشود و به CMA اختیار داده شده روی اکوسیستم جستوجوی گوگل الزامات قابل اجرا بگذارد؛ الزامات نهایی قانونی و قابل اجرایند و میتوانند بهصورت خاص به رفتار crawling مرتبط با AI بپردازند.
مسئلهٔ اصلی برای ناشران این است که آنها راه واقعیای برای جلوگیری از استفادهٔ Google از محتوایشان در سرویسهای generative AI ندارند. همان محتوایی که Google برای ایندکس جستوجو میخزد، در عمل برای inference/grounding در AI Overviews و AI Mode هم استفاده میشود؛ یعنی محتوا در پاسخهای بلادرنگ کاربران بهعنوان «پایه» به کار میآید و این برای ناشران و رقابت مشکلساز است. ⚠️
چون ناشران بهسختی میتوانند Googlebot را بلاک کنند (زیرا از طریق Search ترافیک و درآمد تبلیغی بهدست میآورند)، ناچارند قبول کنند محتوایشان در پاسخهای generative AI داخل Google نمایش داده شود—تعریفاً بدون اینکه لزوماً ترافیک یا کسب درآمد قابلتوجهی بهسمت سایت منتشرکننده بازگردد. این وضعیت مدلهای کسبوکار مبتنی بر تبلیغات را تضعیف میکند و در عمل سرویسهای generative گوگل را رقیب مستقیم ناشران میسازد؛ اغلب بدون attribution یا پرداخت.
این ترک ناشران در موضع ضعف، به Google برتری رقابتی ناعادلانهای میدهد. برخلاف سایر اپراتورهای AI، گوگل میتواند با خیال راحت از crawler جستوجویش برای جمعآوری دادههای مختلف AI استفاده کند و انگیزهٔ کمی برای پرداخت به ناشران دارد، چون دادهها را رایگان دریافت میکند. در نتیجه بازار سالمی که در آن توسعهدهندگان AI برای محتوا ارزش منصفانهای مذاکره کنند شکل نمیگیرد و رقبای دیگر از حضور در این میدان دلسرد میشوند.
دادههای Cloudflare این نگرانی را تأیید میکنند: Googlebot نسبت به نزدیکترین رقبا حجم محتوای اینترنت را بهطور معنیداری بیشتر میبیند. در بازهٔ دو ماههٔ مشاهدهشده، Googlebot تقریباً دو برابر ClaudeBot و GPTBot، سه برابر Meta-ExternalAgent و بیش از سه برابر Bingbot صفحات را با موفقیت دسترسی یافته است؛ و برای برخی crawlers تفاوتها بهمراتب شدیدتر است (برای مثال نسبت به PerplexityBot بیشتر از ۱۶۷ برابر). این اختلاف در دسترسی منبع قدرت عملی بزرگی برای گوگل میسازد. 📊
حتی در دیگر مجموعهدادههای Cloudflare نیز Googlebot متفاوت است: اگرچه بیشترین ترافیک بات را دارد، ناشران به مراتب کمتر Googlebot را در فایل robots.txt خود disallow میکنند—چون حذفش بهمعنای از دست دادن ترافیک انسانی و در نتیجه درآمد تبلیغی است. توجه کنید که robots.txt فقط ترجیحات crawling را اعلام میکند و مکانیزم اجرایی نیست؛ ناشران به «good bots» اعتماد میکنند که مقررات را رعایت کنند.
برای کنترل مؤثرتر دسترسی، ناشران میتوانند با استفاده از یک Web Application Firewall (WAF) قوانین فنی تعریف کنند تا crawlerهای ناخواسته را عملاً منع کنند. بر همین اساس، دادهها نشان میدهد سایتها معمولاً دیگر AI crawlers را بیشتر بلاک میکنند تا Googlebot. در مقایسهٔ ابزار Cloudflare بهنام AI Crawl Control بین جولای ۲۰۲۵ تا ژانویه ۲۰۲۶، تعداد سایتهایی که GPTBot یا ClaudeBot را بلاک کردهاند تقریباً هفت برابر سایتهایی است که Googlebot و حتی Bingbot را بلاک کردهاند.
ما با تشخیص مشکل CMA موافقیم: ناشران باید توانایی مؤثری برای opt out از استفادهٔ Google از محتوای Search خود در هر دو بخش search generative AI و broader generative AI داشته باشند. اما از آنسو نگرانیم که پیشنهادات CMA کافی نباشد و نیاز به مکانیسمهای عملیتر و قابلاجراتری هست تا ناشران واقعاً کنترل اختیار شده را داشته باشند. 🤝
پیشنهادات CMA برای ناشران (خلاصه): در ۲۸ ژانویهٔ ۲۰۲۶ CMA چهار مجموعه الزام رفتاری پیشنهادی برای Google منتشر کرد که شامل مقرراتی برای ناشران است. هدف این قواعد حل سه مسئله اصلی است: (۱) نبود انتخاب کافی ناشران دربارهٔ نحوهٔ استفادهٔ Google از محتوایشان در پاسخهای AI، (۲) شفافیت محدود دربارهٔ استفادهٔ Google از محتوا، و (۳) فقدان attribution مؤثر.
بر اساس پیشنهاد، Google باید کنترل «معنادار و مؤثر» به ناشران بدهد تا تعیین کنند محتوایشان برای ویژگیهای AI مثل AI Overviews استفاده شود یا نه، و نباید اقدامی کند که عملاً این کنترلها را بیاثر سازد (مثلاً downranking عمدی). همچنین لازم است Google شفافیت را افزایش دهد—مستندات روشنی منتشر کند که چگونه محتوای crawled را برای generative AI استفاده میکند و دقیقاً کنترلهای publisher در عمل چه چیزهایی را شامل میشوند. در نهایت، پیشنهاد خواستار attribution مؤثر و ارائهٔ دادههای engagement تفکیکشده به ناشران است تا تصمیمگیری آگاهانه ممکن شود. 📣
جمعبندی برای مخاطبان DevOps/SRE: اگر شما مسؤول زیرساخت یا امنیت وب در یک سازمان نشر هستید، نکات عملی مهماند: (۱) به محدودیتهای robots.txt و نیاز به ابزارهای اجراییتر مثل WAFها آگاه باشید؛ (۲) بررسی و مانیتورینگ رفتار crawlers (نظیر Googlebot، GPTBot، ClaudeBot) را در خط لولهٔ observability خود قرار دهید؛ (۳) منتظر استانداردهای فنی یا پروتکلهای جدید برای opt-out باشید که ممکن است توسط تنظیمگرها یا کنسرسیومها پیشنهاد شود؛ و (۴) در طرحهای محافظت از ترافیک و تحلیل لاگها، تمایز بین ترافیک search-driven و AI-driven را لحاظ کنید تا بتوانید گزارشات disaggregated که ناشران طلب میکنند را تولید یا مصرف کنید.
در نهایت، برای اینکه فضای رقابتی و اقتصادی سالمی شکل بگیرد، نیاز به راهحلهای فنی قابل اجرا و الزامآور وجود دارد—نه صرفاً توصیههای اخلاقی یا راهنماهای غیراجعبند. این فرصت خوبی است تا جامعهٔ فنی و سیاستگذارها با هم استانداردهایی عملی برای کنترلِ استفاده از محتوا و شفافیت متقابل طراحی کنند. 🔧