کانال تلگرام فراسوعضو شوید
آموزش سئو
سئو برای جستجوی هوش مصنوعی (AI Search)

خزنده‌های هوش مصنوعی چطور سایت شما را می‌خوانند

4 دقیقه مطالعه

پیش از آنکه هر سامانه‌ی هوش مصنوعی بتواند به صفحه‌ی شما ارجاع بدهد، چیزی باید آن را دریافت کند. این کار را خزنده‌ها انجام می‌دهند، چند شرکت خزنده‌ی خودشان را دارند، و هرکدام از دستوری جداگانه در فایلی پیروی می‌کنند که بیشتر صاحبان سایت هیچ‌وقت بازش نکرده‌اند. این صفحه توضیح می‌دهد چه کسی در می‌زند، چطور ببینیدشان، و چطور تصمیم بگیرید چه چیزی را اجازه بدهید.

چه کسی واقعاً در می‌زند

خزنده برنامه‌ای خودکار است که صفحه‌ها را مثل یک مرورگر دانلود می‌کند، اما بدون اینکه کسی پایش نشسته باشد. خودش را با یک عامل کاربر (user agent) معرفی می‌کند — نامی کوتاه در درخواست، مثل Googlebot — و خزنده‌های خوش‌رفتار اول robots.txt را می‌خوانند. آن فایل در ریشه‌ی سایت شما قرار دارد، در yoursite.com/robots.txt، و می‌گوید هر عامل نام‌برده‌شده اجازه‌ی دریافت کدام مسیرها را دارد.

نکته‌ی مهمی که مدام از قلم می‌افتد این است که این‌ها مجوزهای جداگانهاند. اجازه‌دادن به گوگل هیچ چیزی درباره‌ی بقیه نمی‌گوید.

به‌طور کلی این بازدیدکننده‌ها سه دسته‌اند:

  • خزنده‌های جستجو. Googlebot از همه مهم‌تر است. جستجوی گوگل را تغذیه می‌کند و چون AI Overviews قابلیتی درون جستجوست، همان خزش است که شما را واجد شرایط حضور در آن می‌کند. Googlebot را ببندید، هر دو را یک‌جا از دست می‌دهید.
  • خزنده‌های دستیارها. GPTBot، ClaudeBot، PerplexityBot و بقیه، متعلق به شرکت‌های سازنده‌ی همان محصول‌ها. هرکدام با نام خودش در robots.txt کنترل می‌شود.
  • کنترل‌های مستندسازی و آموزش. Google-Extended اصلاً خزنده نیست — هیچ چیزی با این نام صفحه‌ای دریافت نمی‌کند. نشانه‌ای است که می‌توانید ببندید تا بگویید محتوای شما برای محصول‌های مولد گوگل مثل Gemini استفاده نشود. بستن آن شما را از جستجو حذف نمی‌کند و از AI Overviews هم حذف نمی‌کند.

چطور خودتان ببینیدشان

لازم نیست به هیچ فهرستی اعتماد کنید. سرور شما برای هر درخواستی که پاسخ می‌دهد یک سطر می‌نویسد و آن سطرها عامل کاربر را در خود دارند. در لاگ دسترسی دنبال یک نام بگردید تا ببینید آمده یا نه، چند بار، و چه چیزی خواسته است.

ارزش دارد این کار را پیش از هر تغییری انجام دهید، به یک دلیل ساده: پرسش را از «در اصل چه چیزی را باید اجازه بدهم» به «چه کسی واقعاً دارد سایت من را می‌خواند» تبدیل می‌کند. پاسخ اغلب در هر دو جهت غافلگیرکننده است.

مشخصاً برای Googlebot، سرچ کنسول فعالیت خزش را مستقیم گزارش می‌دهد که از خواندن دستی لاگ قابل‌اتکاتر است.

چه کاری انجام دهید

  • yoursite.com/robots.txt را باز کنید و بخوانید. خیلی سایت‌ها قاعده‌هایی دارند که کسی یادش نیست اضافه‌شان کرده باشد، کپی‌شده از قالبی چندسال پیش.
  • مطمئن شوید Googlebot از چیزی که می‌خواهید دیده شود منع نشده است. این پرهزینه‌ترین اشتباه ممکن در این فایل است.
  • درباره‌ی خزنده‌های دستیارها آگاهانه و یکی‌یکی تصمیم بگیرید. اجازه‌دادن راهی است که واجد شرایط ارجاع‌گرفتن شوید؛ ندادن هم انتخابی مشروع درباره‌ی استفاده از کار شماست. هر دو قابل‌دفاع‌اند. آنچه قابل‌دفاع نیست، تصادفی انجام‌دادنش است.
  • اگر می‌خواهید پیدا شوید ولی مفصل نقل نشوید، به‌جای بستن از کنترل‌های گزیده استفاده کنید: nosnippet، max-snippet و ویژگی data-nosnippet روی یک عنصر مشخص. این‌ها محدود می‌کنند چه چیزی نمایش داده شود — از جمله در قابلیت‌های هوش مصنوعی — بی‌آنکه صفحه از ایندکس خارج شود.
  • بعد از هر مهاجرت سایت دوباره بررسی کنید. یک Disallow: / جامانده از سرور آزمایشی، راه کلاسیک ناپدیدشدن است.

اشتباه‌های رایج

پرضررترین اشتباه این است که robots.txt را راهی برای بیرون‌نگه‌داشتن صفحه از نتایج جستجو بدانیم. این فایل دریافت را کنترل می‌کند، نه ایندکس را. صفحه‌ی بسته‌شده اگر سایت‌های دیگر به آن لینک بدهند باز هم می‌تواند فهرست شود، و چون صفحه‌ی بسته خوانده نمی‌شود، گوگل دستور noindex روی آن را هم نمی‌بیند. برای بیرون‌نگه‌داشتن یک صفحه از نتایج، اجازه‌ی خزش بدهید و از noindex استفاده کنید.

دومی این فرض است که Google-Extended روی جستجو اثر دارد. ندارد. کسانی آن را می‌بندند به این امید که از AI Overviews خارج شوند و بعد تعجب می‌کنند که هنوز آنجا هستند، چون AI Overviews از Googlebot پیروی می‌کند.

سومی بستن یک خزنده برای «صرفه‌جویی در پهنای باند» بدون اندازه‌گیری است. اول لاگ را ببینید؛ در بیشتر سایت‌های کوچک این ترافیک ناچیز است.

robots.txt یک درخواست است، نه یک قفل. خزنده‌های خوش‌رفتار رعایتش می‌کنند و هر چیزی که با نیت بد کار کند صرفاً نادیده‌اش می‌گیرد. اگر محتوایی واقعاً نباید خوانده شود، به احراز هویت نیاز دارد، نه به یک سطر در یک فایل متنی.

منابع: مستندات Google Search Central درباره‌ی خزنده‌ها و دریافت‌کننده‌های گوگل و قابلیت‌های هوش مصنوعی در جستجوی گوگل. برای تفاوت بستن و حذف از ایندکس، نقشه سایت و robots.txt را ببینید.

این مطلب برایتان مفید بود؟

شمارش آرا پس از ۵ رأی نمایش داده می‌شود.

مطمئن نیستید این روی سایت شما اثر دارد؟

آدرس سایتتان را بفرستید تا آن را از نظر همین مورد و بقیه‌ی فهرست بررسی کنم و نتیجه را برایتان بفرستم. بدون هزینه.

درخواست بررسی رایگان

مقالات مرتبط