چرا سایت در گوگل ایندکس نمی‌شود؟ ۱۲ علت و روش تشخیص

وقتی صفحه‌ای در گوگل ایندکس نمی‌شود، اولین واکنش بسیاری از مدیران سایت این است که چند بار روی گزینه «درخواست ایندکس» در سرچ کنسول کلیک کنند. این کار فقط زمانی مفید است که صفحه از نظر فنی قابل دسترس و از نظر محتوایی ارزشمند باشد. اگر سرور پاسخ ندهد، صفحه noindex باشد، canonical به نشانی دیگری اشاره کند یا گوگل صفحه را کم‌ارزش تشخیص دهد، ارسال دوباره درخواست چیزی را اصلاح نمی‌کند.

برای حل مسئله باید بین سه مرحله تفاوت بگذاریم: کشف URL، خزش و ایندکس. ممکن است گوگل هنوز نشانی صفحه را پیدا نکرده باشد؛ ممکن است آن را پیدا کرده اما نتوانسته بخزد؛ یا صفحه را خزیده ولی تصمیم گرفته وارد فهرست نتایج نکند. پیام سرچ کنسول و پاسخ واقعی سرور مشخص می‌کنند مشکل در کدام مرحله است.

اگر نمی‌خواهید این بررسی را به‌صورت دستی انجام دهید، در صفحه آنالیز سئو سایت جزئیات بررسی فنی، محتوایی و وضعیت ایندکس را توضیح داده‌ایم. اما اگر خودتان دسترسی فنی دارید، مراحل زیر نقطه شروع دقیقی هستند.

پیش از هر کاری: آیا صفحه واقعاً ایندکس نشده است؟

در Google Search Console نشانی کامل صفحه را در ابزار URL Inspection وارد کنید. عبارت «URL is not on Google» به‌تنهایی علت را مشخص نمی‌کند. بخش‌های Page indexing و Crawl را باز کنید و این موارد را یادداشت کنید:

  • آیا URL برای گوگل شناخته شده است؟
  • آخرین زمان Crawl چه تاریخی بوده است؟
  • Page fetch موفق بوده یا شکست خورده است؟
  • Crawling allowed و Indexing allowed چه وضعیتی دارند؟
  • User-declared canonical و Google-selected canonical یکسان هستند؟

سپس روی Test Live URL بزنید. نتیجه زنده با اطلاعات آخرین خزش فرق دارد. ممکن است خطایی را دیروز برطرف کرده باشید ولی گزارش اصلی هنوز نسخه قبلی را نشان دهد. آزمون زنده مشخص می‌کند گوگل همین حالا چه می‌بیند.

فلوچارت تشخیص مشکل ایندکس گوگل

۱. سایت یا صفحه پاسخ موفق HTTP نمی‌دهد

گوگل برای ایندکس کردن یک صفحه معمولاً باید پاسخ 200 OK دریافت کند. خطاهای 500، 502 و 503 نشان‌دهنده مشکل سرور هستند؛ 404 و 410 می‌گویند محتوا وجود ندارد؛ و 403 یعنی دسترسی خزنده رد شده است. Timeout و Connection refused حتی اجازه دریافت پاسخ HTTP را نمی‌دهند.

آزمایش را فقط از مرورگر خودتان انجام ندهید. ممکن است سایت برای شما از کش، شبکه داخلی یا نشست مدیریت باز شود ولی برای کاربران بیرونی و Googlebot قابل دسترس نباشد. وضعیت سرور، فایروال، CDN و گزارش uptime را بررسی کنید. اگر چند URL هم‌زمان خطای سرور دارند، مشکل را در سطح هاست یا وب‌سرور حل کنید، نه در افزونه سئو.

۲. متای noindex یا هدر X-Robots-Tag فعال است

وجود این کد در HTML به گوگل می‌گوید صفحه وارد نتایج نشود:

<meta name="robots" content="noindex, follow">

همین دستور ممکن است در هدر HTTP با نام X-Robots-Tag ارسال شود و در منبع HTML دیده نشود. این اتفاق بعد از انتقال سایت آزمایشی به دامنه اصلی، فعال ماندن گزینه «از موتورهای جستجو درخواست کن محتوای سایت را بررسی نکنند» در وردپرس یا تنظیم اشتباه افزونه‌های سئو رایج است.

تنها حذف noindex کافی نیست. پس از اصلاح، کش سایت و CDN را پاک کنید، دوباره Test Live URL بگیرید و مطمئن شوید نسخه‌ای که گوگل دریافت می‌کند دستور قبلی را ندارد.

۳. robots.txt جلوی خزش را گرفته است

دستور زیر تمام سایت را برای ربات‌های سازگار مسدود می‌کند:

User-agent: *
Disallow: /

مسدود کردن در robots.txt با noindex یکسان نیست. robots.txt مانع خزش محتوا می‌شود، درحالی‌که noindex پس از خزش به موتور جستجو می‌گوید صفحه را ایندکس نکند. برای صفحات عمومی، فایل را در domain.ir/robots.txt باز کنید و مسیر URL را با قواعد آن تطبیق دهید. مسیرهای مدیریت، نتایج جستجوی داخلی و پارامترهای بی‌ارزش را می‌توان محدود کرد؛ صفحات خدمات، دسته‌بندی‌های مهم و مقالات نباید ناخواسته مسدود شوند.

۴. canonical به صفحه دیگری اشاره می‌کند

تگ canonical به گوگل می‌گوید نسخه ترجیحی محتوا کدام URL است. اگر مقاله A به صفحه B canonical شده باشد، درخواست ایندکس A معمولاً نتیجه مطلوبی ندارد؛ شما عملاً اعلام کرده‌اید B نسخه اصلی است.

در کد صفحه به دنبال این تگ بگردید:

<link rel="canonical" href="https://example.com/preferred-url/">

برای صفحات منحصربه‌فرد، canonical باید معمولاً به خود همان URL اشاره کند. دامنه، پروتکل، وجود یا نبود www و اسلش انتهایی باید با نسخه نهایی سایت هماهنگ باشند. تفاوت User-declared canonical و Google-selected canonical نیز هشداری است که ممکن است محتوای شما بسیار شبیه صفحه دیگری باشد.

۵. URL فقط از طریق sitemap معرفی شده و لینک داخلی ندارد

نقشه سایت به کشف URL کمک می‌کند، اما جای معماری سایت و لینک داخلی را نمی‌گیرد. صفحه‌ای که از منو، دسته‌بندی، صفحه مادر یا مقاله مرتبط هیچ لینکی دریافت نمی‌کند، برای کاربر هم پیدا کردنش دشوار است. چنین صفحه‌ای معمولاً «یتیم» نامیده می‌شود.

هر مقاله باید از صفحه دسته‌بندی و حداقل یک یا دو محتوای مرتبط لینک دریافت کند. صفحات تجاری نیز باید از ناوبری اصلی یا صفحات مادر قابل دسترس باشند. برای نمونه، این مقاله علاوه بر دسته «سئو تکنیکال»، باید از مطالب چرا سرچ کنسول ایمپرشن ندارد؟ و سئو تکنیکال چیست؟ لینک بگیرد.

۶. صفحه تازه است و هنوز کشف یا بازخزش نشده است

ایندکس فوری نیست. سایت تازه، دامنه بدون لینک ورودی و صفحه‌ای که در عمق معماری قرار دارد ممکن است دیرتر کشف شود. URL را در sitemap قرار دهید، از یک صفحه معتبر داخلی به آن لینک بدهید و یک‌بار درخواست ایندکس ثبت کنید. ارسال مکرر همان درخواست سرعت را تضمین نمی‌کند.

اگر چند روز گذشته و حتی در گزارش Crawl اثری از درخواست نیست، سلامت sitemap و لینک‌های داخلی را بررسی کنید. اگر صفحه خزیده شده ولی ایندکس نشده، مسئله احتمالاً کشف نیست و باید سراغ کیفیت، شباهت یا canonical بروید.

۷. محتوا تکراری یا بسیار شبیه صفحه دیگری است

فروشگاه‌ها و سایت‌های خدماتی معمولاً چند URL با محتوای تقریباً یکسان می‌سازند: فیلترها، برچسب‌ها، صفحات چاپ، پارامترهای کمپین، نسخه‌های HTTP و HTTPS یا خدمات مشابه با متن‌های جایگزین‌شده. گوگل ممکن است یکی را انتخاب و بقیه را با پیام‌هایی مانند Duplicate without user-selected canonical کنار بگذارد.

به جای تغییر چند واژه، هدف هر صفحه را مشخص کنید. دو صفحه‌ای که به یک نیاز پاسخ می‌دهند باید ادغام شوند یا تفاوت واقعی در پیشنهاد، مثال، مخاطب و محتوای اصلی داشته باشند. canonical و ریدایرکت ابزار پاک‌کردن معماری ضعیف نیستند؛ ابتدا تصمیم بگیرید کدام URL باید باقی بماند.

۸. صفحه «Crawled – currently not indexed» است

این پیام یعنی گوگل صفحه را دریافت کرده ولی فعلاً آن را برای ایندکس مناسب ندانسته است. خطای فنی قطعی نیست. معمولاً باید ارزش صفحه را نسبت به نتایج موجود بررسی کنید:

  • آیا محتوا پاسخ کامل و مشخصی می‌دهد یا صرفاً مقدمه‌های عمومی دارد؟
  • آیا اطلاعات دست‌اول، تصویر، نمونه، داده یا تجربه‌ای ارائه می‌کند؟
  • آیا عنوان وعده‌ای می‌دهد که متن به آن عمل نمی‌کند؟
  • آیا صفحه عملاً نسخه ضعیف‌تر محتوای دیگری در همان سایت است؟
  • آیا بخش اصلی محتوا در HTML قابل مشاهده است؟

در این وضعیت، اضافه کردن هزار کلمه عمومی راه‌حل نیست. صفحه باید چیزی ارائه کند که کاربر برای همان سؤال واقعاً نیاز دارد و در نتایج مشابه به‌سادگی پیدا نمی‌شود.

۹. صفحه «Discovered – currently not indexed» است

گوگل URL را می‌شناسد اما هنوز آن را نخزیده است. این وضعیت در سایت‌های بزرگ با تعداد زیادی URL کم‌ارزش، سرور کند یا صفحات فیلترشده بیشتر دیده می‌شود. تعداد صفحات تولیدشده توسط پارامترها، تقویم‌ها، جستجوی داخلی و تگ‌های خودکار را کاهش دهید. سرعت و پایداری سرور را بررسی کنید و صفحات مهم را در عمق کم‌تری از صفحه اصلی قرار دهید.

اگر سایت فقط چند ده صفحه دارد و این وضعیت طولانی شده، ابتدا مطمئن شوید سرور در زمان مراجعه Googlebot خطا یا کندی شدید ندارد.

۱۰. ریدایرکت اشتباه یا زنجیره‌ای وجود دارد

URLی که به صفحه دیگری ریدایرکت می‌شود خودش معمولاً ایندکس نخواهد شد؛ مقصد ریدایرکت کاندید ایندکس است. زنجیره‌هایی مانند A ← B ← C زمان خزش را تلف می‌کنند و احتمال خطا را بالا می‌برند. تمام نسخه‌های قدیمی باید با یک ریدایرکت مستقیم 301 به نزدیک‌ترین مقصد مرتبط برسند.

ریدایرکت صفحه حذف‌شده به صفحه اصلی، وقتی جایگزین مرتبطی وجود ندارد، ممکن است soft 404 تلقی شود. در این حالت بهتر است پاسخ واقعی 404 یا 410 بدهید و لینک‌های داخلی را اصلاح کنید.

۱۱. محتوای اصلی فقط پس از تعامل یا اجرای ناقص جاوااسکریپت ظاهر می‌شود

گوگل می‌تواند بسیاری از صفحات جاوااسکریپتی را رندر کند، اما وابستگی کامل به اجرای اسکریپت، خزش و تشخیص محتوا را پیچیده‌تر می‌کند. در View Source بررسی کنید عنوان، متن اصلی و لینک‌های مهم در HTML اولیه حضور دارند یا نه. در URL Inspection نیز اسکرین‌شات و HTML رندرشده را ببینید.

لینک‌های اصلی باید تگ استاندارد <a href="..."> داشته باشند. دکمه‌ای که فقط با رویداد جاوااسکریپت مسیر را عوض می‌کند ممکن است به‌اندازه لینک HTML قابل کشف نباشد. برای سایت خدماتی کوچک، ارائه محتوای اصلی به‌صورت server-rendered معمولاً مطمئن‌تر است.

۱۲. مشکل امنیتی، اقدام دستی یا دامنه تازه‌انتقال‌یافته وجود دارد

گزارش‌های Manual actions و Security issues را در سرچ کنسول بررسی کنید. هک، صفحات اسپم و بدافزار می‌توانند اعتماد و نمایش سایت را آسیب بزنند. همچنین پس از مهاجرت دامنه، تغییر ساختار URL یا انتقال HTTP به HTTPS، نبود ریدایرکت‌های صحیح باعث می‌شود گوگل با مجموعه‌ای از نشانی‌های قدیمی و جدید روبه‌رو شود.

در مهاجرت، هر URL قدیمی باید به همتای دقیق جدید برسد. canonical، sitemap، لینک‌های داخلی و نسخه‌های ثبت‌شده در ابزارهای تحلیلی باید همگی با دامنه نهایی هماهنگ شوند.

ترتیب پیشنهادی برای رفع مشکل ایندکس

برای جلوگیری از آزمون‌وخطای بی‌هدف، این ترتیب را اجرا کنید:

  1. پاسخ HTTP و دسترسی عمومی صفحه را آزمایش کنید.
  2. noindex، X-Robots-Tag و robots.txt را بررسی کنید.
  3. canonical و ریدایرکت را با URL نهایی تطبیق دهید.
  4. URL را در sitemap و لینک‌های داخلی قرار دهید.
  5. گزارش و آزمون زنده URL Inspection را مقایسه کنید.
  6. کیفیت و تمایز صفحه را نسبت به صفحات مشابه ارزیابی کنید.
  7. پس از اصلاح واقعی، یک‌بار درخواست ایندکس ثبت کنید.
  8. نتیجه را در بازه زمانی معقول پایش کنید؛ درخواست را روزانه تکرار نکنید.

جمع‌بندی

ایندکس نشدن یک «خطای واحد» نیست. گاهی سرور اجازه دسترسی نمی‌دهد، گاهی سایت خودش با noindex یا canonical مانع می‌شود و گاهی گوگل صفحه را دیده اما ارزش کافی برای نگهداری در فهرست تشخیص نداده است. بنابراین راه‌حل باید از شواهد شروع شود: پاسخ سرور، URL Inspection، کد HTML و معماری لینک‌ها.

اگر چندین صفحه مهم شما با وضعیت‌های متفاوت خارج از ایندکس مانده‌اند، یک آنالیز سئو سایت می‌تواند مسئله را بر اساس اثر تجاری اولویت‌بندی کند؛ چون رفع یک خطای قالب که صد صفحه را درگیر کرده، معمولاً مهم‌تر از درخواست دستی ایندکس برای تک‌تک URLها است.

پرسش‌های متداول

ایندکس شدن یک صفحه چقدر طول می‌کشد؟

زمان ثابتی وجود ندارد. صفحه ممکن است طی چند ساعت کشف شود یا چند هفته منتظر خزش بماند. قدمت دامنه، کیفیت لینک‌های داخلی، پایداری سرور و ارزش محتوا بر این زمان اثر می‌گذارند.

آیا درخواست ایندکس تضمین می‌کند صفحه وارد گوگل شود؟

خیر. این درخواست فقط URL را برای بررسی در صف خزش قرار می‌دهد. تصمیم نهایی به دسترسی فنی، canonical، دستورهای ایندکس و کیفیت صفحه وابسته است.

آیا قرار دادن URL در sitemap کافی است؟

خیر. sitemap کشف را آسان‌تر می‌کند، اما لینک داخلی، پاسخ موفق سرور و محتوای قابل ایندکس همچنان لازم‌اند.

آیا robots.txt می‌تواند صفحه را noindex کند؟

robots.txt ابزار کنترل خزش است، نه روش مطمئن حذف از ایندکس. برای جلوگیری از ایندکس باید اجازه خزش بدهید و noindex ارسال کنید یا صفحه را با احراز هویت محدود کنید.

چرا صفحه من خزیده شده ولی ایندکس نشده است؟

اغلب باید شباهت با صفحات دیگر، کامل بودن پاسخ، محتوای اصلی، canonical و کیفیت کلی را بررسی کرد. عبارت Crawled – currently not indexed الزاماً یک خطای فنی مشخص را نشان نمی‌دهد.

منابع اصلی برای بررسی بیشتر