ربات ChatGPT ممکن است فایل robots.txt را نادیده بگیرد: توضیحات OpenAI
ربات ChatGPT دستورات فایل robots.txt شما را دور میزند
گزارش جدیدی نشان میدهد که ربات خزنده ChatGPT به صفحاتی دسترسی پیدا میکند که در فایل robots.txt مسدود شدهاند. OpenAI توضیح میدهد که چون این درخواستها توسط کاربران آغاز میشود، ممکن است قوانین robots.txt برای آن اعمال نشود. این موضوع چالشهای جدیدی برای کنترل دسترسی رباتهای هوش مصنوعی به محتوای وبسایتها ایجاد کرده است.
دادههای جدید نشان میدهد که ربات واکشی صفحه (page-fetching) چتجیپیتی (ChatGPT) به سایتهایی دسترسی پیدا میکند که دسترسی آن را مسدود کردهاند و مستندات خود اوپنایآی (OpenAI) نیز توضیح میدهد که چرا این فایل ممکن است جلوی آن را نگیرد.
ربات ChatGPT-User توسط سایتهای بیشتری نسبت به هر ربات هوش مصنوعی دیگری مسدود شده است. با این حال، این ربات به صفحات مسدود شده در سایتهای بیشتری نسبت به سایر رباتها نیز دسترسی پیدا کرده است. OpenAI میگوید قوانین robots.txt ممکن است برای این ربات اعمال نشود، زیرا یک شخص درخواست مشاهده صفحه را داده است.
در گزارش اخیر «وضعیت رباتها» از شرکت تولبیت (TollBit)، آمار جالبی ارائه شده است. در سایتهای اروپایی مورد بررسی، حدود ۱۵٪ از رباتهای واکشی صفحه هوش مصنوعی شناساییشده به URLهایی دسترسی پیدا کردهاند که سایتها آنها را مسدود کرده بودند.
این اتفاق بیشتر با چند عامل خاص رخ میدهد. به عنوان مثال، ChatGPT-User، بایتاسپایدر (Bytespider) و یوبات (Youbot) هر کدام به صفحات مسدود شده در تقریباً نیمی از سایتهای اروپایی که صراحتاً آنها را در لیست مسدودی قرار داده بودند، دسترسی داشتند. در میان اینها، ChatGPT-User به بیشترین تعداد سایت دسترسی پیدا کرده است.
در مقابل، بسیاری از رباتهای جدیدتر به ندرت مسدود میشوند. برای مثال، تنها ۹٪ از وبسایتهای اروپایی ربات Claude-User را مسدود کردهاند، در حالی که این رقم در آمریکای شمالی ۲۶٪ است. این آمار برای Perplexity-User به ترتیب ۱۳٪ و ۲۶٪ است.
مستندات خزشگر OpenAI بیان میکند که ChatGPT-User زمانی از یک صفحه بازدید میکند که کاربر ChatGPT سؤالی بپرسد و از آنجا که این اقدامات توسط کاربر آغاز میشود، قوانین robots.txt ممکن است اعمال نشوند.
شرکت پرپلکسیتی (Perplexity) نیز میگوید ربات Perplexity-User به همین دلیل عموماً این فایل را نادیده میگیرد. اما شرکت انتروپیک (Anthropic) دیدگاه متفاوتی دارد و اعلام کرده که هر سه ربات آن به این فایل احترام میگذارند. شرکت TollBit هر درخواستی به یک URL مسدود شده را، صرفنظر از ادعای اپراتور، یک «دور زدن» تلقی میکند.
این موضوع برای وبسایتهای ایرانی اهمیت ویژهای دارد. دستور مسدودسازی (disallow) برای ChatGPT-User در فایل robots.txt تنها یک «درخواست» است که طبق مستندات OpenAI، ممکن است رعایت نشود. این یعنی محتوای فارسی شما ممکن است حتی در صورت تلاش برای مسدودسازی، توسط این ربات خوانده و در پاسخهای ChatGPT استفاده شود.
نکته کلیدی در اینجاست: طبق مستندات OpenAI، رباتی که مسئول تصمیمگیری برای نمایش یک سایت در نتایج جستجوی ChatGPT است، OAI-SearchBot نام دارد، نه ChatGPT-User. سایتهایی که هر دو ربات را برای جلوگیری از ترافیک هوش مصنوعی مسدود میکنند، در واقع بخش «نمایش در نتایج» را از دست دادهاند، در حالی که کنترلی که برای واکشی صفحه اعمال کردهاند، خود دارای یک استثنا است.
بهترین راه برای فهمیدن اینکه چه اتفاقی واقعاً در حال رخ دادن است، بررسی لاگهای سرور یا رکوردهای CDN شماست. فایل robots.txt فقط نشان میدهد شما چه درخواستی داشتهاید، اما لاگها نشان میدهند چه کسی واقعاً به سایت شما آمده است.
در آینده، شرکتهایی مانند کلادفلر (Cloudflare) در حال بهروزرسانی کنترلهای خزشگر خود و انتقال تصمیمگیری به لایه شبکه هستند. با این رویکرد، پایبندی به قوانین دیگر به خود خزشگر واگذار نمیشود. از ۱۵ سپتامبر، دامنههای جدیدی که به Cloudflare اضافه میشوند، به طور پیشفرض خزشگرهای آموزشی و نمایندگان هوش مصنوعی را در صفحاتی که تبلیغات دارند مسدود میکنند، در حالی که به خزشگرهای جستجو اجازه دسترسی داده میشود.
سوال اصلی این است که آیا این «راه گریز» مبتنی بر درخواست کاربر پابرجا خواهد ماند یا خیر. این استدلال بر این اساس است که درخواست یک صفحه توسط کاربر با برداشتن آن توسط یک خزشگر متفاوت است و اکنون تمام دستیارهای اصلی هوش مصنوعی صفحات را به این روش واکشی میکنند.
چرا مهم است؟
این خبر وبمسترهای ایرانی را وادار میکند تا استراتژی خود را برای کنترل دسترسی رباتهای هوش مصنوعی بازنگری کرده و برای مشاهده ترافیک واقعی، به تحلیل لاگهای سرور روی بیاورند.
اقتباسی از: Search Engine Journal - News
نظرات (۰)
هنوز نظری ثبت نشده — اولین نفر باشید.