چرا Disallow در robots.txt با noindex متفاوت است: درسهایی از ایندکس شدن چتهای Claude
اشتباه فنی Claude AI اطلاعات کاربران را در گوگل فاش کرد
نکات کلیدی
- چتهای اشتراکگذاریشده کاربران Claude، شامل اطلاعات حساس، به دلیل یک پیکربندی اشتباه در نتایج گوگل ایندکس شدند.
- علت اصلی، تداخل بین دستور Disallow در فایل robots.txt و تگ noindex بود که مانع از مشاهده دستور noindex توسط گوگل میشد.
- این رویداد تفاوت حیاتی بین «مسدود کردن خزش» (Disallow) و «جلوگیری از ایندکس» (noindex) را نشان میدهد.
اخیراً چتهای اشتراکگذاریشده کاربران پلتفرم هوش مصنوعی Claude به دلیل یک اشتباه فنی رایج در نتایج جستجوی گوگل ظاهر شدند. این اتفاق یک درس مهم را برای متخصصان سئو برجسته میکند: مسدود کردن دسترسی رباتهای جستجو با فایل robots.txt مانع از ایندکس شدن یک صفحه نمیشود و برای این کار باید از تگ noindex استفاده کرد.
طی روزهای گذشته، چتهای اشتراکگذاریشده کاربران پلتفرم هوش مصنوعی Claude به طور غیرمنتظرهای در نتایج جستجوی گوگل ظاهر شدند و نگرانیهایی را در مورد حریم خصوصی ایجاد کردند.
بررسیهای فنی در تاریخ ۲۷ جولای نشان داد که صفحات اشتراکگذاریشده Claude دارای یک تگ noindex بودند، اما این تگ پشت یک دستور مسدودکننده در فایل robots.txt پنهان شده بود. به عبارت دیگر، فایل robots.txt به ربات گوگل اجازه نمیداد صفحه را بخواند تا متوجه دستور noindex شود.
مسیر اشتراکگذاری (/share/) در فایل robots.txt سایت claude.ai مسدود شده بود. همزمان، این صفحات یک هدر X-Robots-Tag با مقدار «none» ارسال میکردند که طبق راهنمای گوگل، معادل noindex و nofollow است.
این دو دستور با یکدیگر در تضاد هستند. طبق راهنمای گوگل، تگ noindex تنها زمانی کار میکند که خزندهی گوگل اجازه دسترسی و خواندن صفحه را داشته باشد. اگر یک صفحه توسط robots.txt مسدود شود، گوگل همچنان میتواند آن را ایندکس کند، به خصوص اگر صفحات دیگر به آن لینک داده باشند. در این حالت، Googlebot بدون باز کردن صفحه، فقط URL آن را ثبت و ایندکس میکند.
این مشکل تنها به شرکتهای هوش مصنوعی محدود نمیشود. اگر گوگل در هر وبسایتی به یک URL مسدود شده برخورد کند که از جای دیگری لینک گرفته، میتواند آن URL را بدون خواندن محتوا و تگ noindex، در نتایج جستجو لیست کند.
گزارشها حاکی از آن است که در میان اطلاعات فاش شده، موارد حساسی مانند اطلاعات پزشکی، اسناد داخلی شرکتها و فایلهایی حاوی نام و شماره تلفن کودکان دبستانی نیز وجود داشته است. مشخص نیست که آیا هدر noindex قبل از این اتفاق وجود داشته است یا خیر، اما در زمان بررسی، این پیکربندی اشتباه همچنان برقرار بود.
این رویداد یک اصل کلیدی در سئو را که گوگل سالهاست بر آن تأکید میکند، یادآوری میکند: فایل robots.txt به موتورهای جستجو میگوید چگونه سایت شما را بخزند، اما تعیین نمیکند چه چیزی ایندکس شود. جان مولر از گوگل توضیح میدهد که حتی صفحات مسدود شده با robots.txt نیز در صورت دریافت لینک، ممکن است در نتایج جستجو ظاهر شوند. برای جلوگیری قطعی از ایندکس شدن یک صفحه، باید از تگ noindex استفاده کنید و اجازه دهید گوگل آن را ببیند.
این درس برای متخصصان دیجیتال مارکتینگ در ایران اهمیت ویژهای دارد. بسیاری از وبسایتهای ایرانی ممکن است به اشتباه برای پنهان کردن صفحات حساس (مانند پنلهای کاربری، پیشنویسها یا صفحات مدیریت) تنها به فایل robots.txt اکتفا کنند. این کار نه تنها مانع ایندکس شدن نمیشود، بلکه میتواند منجر به نمایش URLهای حساس در نتایج جستجوی گوگل شود. ابزارهای استانداردی مانند Google Search Console که در ایران کاملاً در دسترس هستند، به شناسایی و رفع چنین خطاهایی کمک شایانی میکنند.
شرکت Anthropic، سازنده Claude، در پاسخ اعلام کرد که لینکهای اشتراکگذاریشده تنها در صورتی در نتایج جستجو ظاهر میشوند که کاربران آنها را در مکانهای عمومی و قابل دسترس برای خزندهها منتشر کنند. این پاسخ به نحوه کشف لینکها اشاره دارد اما مشکل اصلی یعنی پیکربندی فنی متناقض را نادیده میگیرد.
به عنوان یک کاربر، به یاد داشته باشید که هر چت یا سندی را که از طریق یک لینک عمومی به اشتراک میگذارید، به طور بالقوه یک صفحه وب عمومی تلقی کنید. اگر محتوایی دارید که نمیخواهید به صورت عمومی دیده شود، از اشتراکگذاری آن از طریق لینکهایی که ممکن است بعداً ایندکس شوند، خودداری کنید.
این الگو برای اولین بار نیست که دیده میشود. پیش از این، OpenAI نیز چتهای اشتراکگذاریشده ChatGPT را از نتایج جستجو حذف کرده بود و گوگل نیز رونوشتهای Bard را از ایندکس شدن مسدود کرد. این تکرار نشان میدهد که باید با لینکهای اشتراکگذاری عمومی، از لحظه ایجاد، مانند یک صفحه وب عمومی رفتار کرد.
چرا مهم است؟
این اتفاق یک درس مهم در سئوی فنی برای متخصصان ایرانی است: استفاده نادرست از robots.txt میتواند منجر به ایندکس شدن ناخواسته صفحات حساس، حتی در وبسایتهای فارسیزبان شود.
اقتباسی از: Search Engine Journal - News
نظرات (۰)
هنوز نظری ثبت نشده — اولین نفر باشید.