سایت آپلود فایل

تجربه شخصی من از مشاوره سئو سایت آپلود فایل!

همه نوع مشاوره سئو داشتم تا اینکه دوستی با من تماس گرفتند و درخواست کمک برای یک سایت در زمینه “آپلود فایل” داشتند!

بدو شناخت قبلی از چنین وبسایت هایی آدرس url را در مرورگر خودم تایپ کردم اما خب این وبسایت نه فروشگاهی بود نه خدماتی (به آن معنای مشخصی که می شناسیم).

این وبسایت یک لندینگ پیج خالی از محتوا داشت!

سایت آپلود فایل

سایت آپلود فایل

کارفرما اشاره داشتند که درست بعد از قطعی اینترنت در زمان جنگ، روی کلمات کلیدی “آپلود فایل” “آپلود عکس با لینک مستقیم“، افت رتبه شدیدی داشتند.

بسیاری از صفحات این سایت از ایندکس خارج شده بود و در باکس crawled currently not index قرار گرفته بود.

بررسی این سایت در نگاه اول بسیار ساده به نظر می رسید! اما وقتی وارد لایه های عمیق آن شدم، به بسیاری از کلاف های سردرگم کننده برای موتورهای جستجو بر خوردم!

در این مقاله می‌خواهم تجربه شخصی، چالش‌ ها و اکشن‌ پلن قدم‌ به‌ قدم خودم را در حل این بحران تکنیکال به اشتراک بگذارم.

چالش اول | فایل robots.txt در سایت های آپلود فایل

  1. بخش بلاگ سایت، ستون های سئو سایت هستند.با بستن دسترسی گوگل به بخش بلاگ، ضربه بزرگی به سایت می زنید!
  2. باید هماهنگی مناسبی بین فایل رباتز، تگ نو ایندکس و تگ های کنونیکال برای فرستادن پیامی منسجم به موتور جستجو وجود داشته باشد.
  3. بستن دسترسی گوگل به برخی صفحات سایت شاید بنظر خوب بنظر برسد، اما با یک تحلیل عمیق متوجه می شویم که کاملا اشتباه کردیم.

موضوعات بالا را داشته باشید تا برسیم به کالبد شکافی هر مورد!

بستن دسترسی به دسته بندی مقالات در فایل رباتز درست است؟

در قدم اول به سراغ بررسی ساختار وبلاگ رفتم تا بفهمم چرا مقالات جدید ایندکس نمی‌شوند. با باز کردن فایل robots.txt با این خطوط مواجه شدم:

فایل robots.txt

فایل robots.txt

این یک اشتباه استراتژیک بزرگ بود.

در معماری سئو، صفحات دسته‌ بندی و آرشیو حکم ستون‌ های اصلی وبلاگ را دارند که اعتبار (Link Juice) را از صفحه اصلی به مقالات زیرمجموعه پمپاژ می‌کنند.

وقتی خزنده‌ های گوگل را پشت درِ دسته‌ بندی‌ ها نگه می‌دارید، مقالات وبلاگ به صفحات یتیم (Orphan Pages) تبدیل می‌شوند.

گوگل ارتباط موضوعی مقالات را درک نمی‌کند، بودجه خزش هدر می‌رود و نتیجه‌ اش می‌شود همان وضعیتِ برزخیِ Crawled – currently not indexed.

راهکار چیست؟

باید دو خط Disallow کاملا پاک شود!

سئوکار قبلی باید چکار می کرد؟

او اگر نگران ایندکس شدن این صفحات بود، باید به جای مسدود کردن این صفحات از فایل رباتز، برای آن ها از تگ noindex, follow استفاده می کرد.

با این کار گوگل این صفحات را ایندکس نمی کند، اما همچنان اعتبار لینک های خارجی آن حفظ خواهد شد.

چالش دوم : پای یو آر ال های غیر امن وسط می آید!

به تصویر نگاه کنید :

رتبه گرفتن آدرس غیر امن

رتبه گرفتن آدرس غیر امن

آیا می توانید درک کنید چه فاجعه ای اتفاق افتاده؟

وقتی مسیر زیر زیر را دنبال کردم :

add filter > Query < exact query و بعد در باکس عبارت “آپلود فایل” که کلیدواژه اصلی این سایت بود را وارد کردم، متوجه شدم آدرس http یا غیر امن صفحه اصلی هم ایمپرشن و کلیک گرفته!

این باعث duplicate content یا محتوای تکراری شده بود (یعنی من به یک صفحه یکتا با دو url مختلف دسترسی دارم).

خب این موضوع به خودی خود باعث افت رتبه می شود! اما سوال اینجاست چرا اصلا این اتفاق افتاده؟

دقیقا بخاطر مشکلات SSL !

گویا در مدت زمان مشخصی، اس اس ال به درستی از سمت سرور کار نکرده و در نتیجه آدرس های غیر ام هم وارد بازی گوگل شده بودند!

راهکار چیست؟

  • به بخش setting سرچ کنسول بروید
  • بخش crawl stats بروید
  • به بخش host بروید
  • روی host stats کلیک کنید
  • سپس روی Server connectivity کلیک کنید.
  • مطمئن شوید در ماه اخیر میزان اتصال و دسترسی پذیری سرورتان در حد استاندارد بوده.

لطفا به تصویر زیر دقت کنید :

قابلیت برقراری ارتباط با سرور

قابلیت برقراری ارتباط با سرور

راهکار دوم اینکه به سرویس میزبانی (هاست) یک تیکت بزنید و مطمئن باشید ssl سایت شما کاملا درست اجرا می شود.

چالش سوم :گره کور صفحات دانلود؛ تناقض بین رباتز و تگ نوآیندکس

بزرگ‌ترین شگفتی این پروژه، تداخل عجیبی بود که در صفحات دانلود فایل (مسیرهای /f/ و /d/) رخ داده بود.

این صفحات مربوط به “دانلود” و “فایل” بودند.

کاربران روزانه هزاران فایل روی سایت آپلود می‌کردند و برای هر فایل یک لینک اختصاصی ساخته می‌شد.

تیم فنی برای اینکه نتایج گوگل پر از صفحات موقت و بی‌ ارزش کاربران نشود، کار درستی انجام داده بود؛ آن‌ها تگ زیر را در هدر صفحات فایل قرار داده بودند:

<meta name=“robots” content=“noindex” />

اما شاهکار اصلی در فایل robots.txt بود، جایی که به طور همزمان دسترسی به این پوشه‌ها کاملاً بسته شده بود

Disallow: */f/
Disallow: */d/

و این یک تناقض بزرگ برای ربات های موتور جستجو بود :

اینجاست که گره کور سئو شکل می‌گیرد!

نکته آموزشی : گوگل بات برای بررسی هر آدرس، ابتدا فایل robots.txt را بررسی می کند.

وقتی با دستور Disallow مواجه می‌شود، اصلاً وارد صفحه نمی‌شود. وقتی وارد صفحه نشود، چطور می‌تواند تگ noindex داخل سورس کد را ببیند؟!

از طرف دیگر، این لینک‌ ها توسط کاربران در سطح وب (شبکه‌های اجتماعی، فروم‌ها و سایت‌های دیگر) به اشتراک گذاشته می‌شدند.

گوگل این آدرس‌ها را از سایت‌ های خارجی کشف می‌کرد، می‌دید در رباتز بسته‌اند، پس آن‌ها را بدون خواندن محتوا و به صورت کورکورانه ایندکس می‌کرد.

این تناقض فنی باعث شد هزاران صفحه در وضعیت Indexed, though blocked by robots.txt قرار بگیرند که یک سیگنال منفی شدید برای الگوریتم‌ های هسته‌ای گوگل است و کل دامنه را به زیر می‌کشد.

 جراحی و پاک‌ سازی

برای نجات سایت، یک استراتژی دو مرحله‌ ای را پیاده‌ سازی کردیم:

گام اول: اصلاح و راست‌آزمایی فایل Robots.txt

یک فایل کاملاً بهینه، سبک و استاندارد بدون کدهای زباله و دامنه‌های خارجی (مثل دیس‌آلو های اشتباهی که برای اینماد و ساماندهی گذاشته شده بود) آماده کردیم.

مهم‌ ترین تغییر، باز کردن موقت مسیر /f/ و /d/ بود:

فایل robots.txt

فایل robots.txt

با این کار، به گوگل اجازه دادیم وارد صفحات دانلود شود، تگ نوآیندکس را با موفقیت بخواند و به مرور تمام آن صفحات زامبی و دیتای اضافه را با احترام از نتایج خود پاک (De-index) کند.

پس از پاک‌ سازی کامل، می‌توان مجدداً برای حفظ بودجه خزش، این مسیر را قفل کرد.

چالش چهارم: تلاش بیهوده برای بستن دامنه‌های خارجی! (اشتباه نگارشی عجیب)

شما از طریق فایل robots.txt تنها می توانید دسترسی به صفحات دامنه خودتان را ببندید نه دامنه های دیگر!!!

یکی دیگر از شاهکارهای عجیبی که در فایل robots.txt قبلی این سایت به چشم می‌خورد، وجود این خطوط بود:

فایل رباتز اشتباه

فایل رباتز اشتباه

کسی که قبلاً این فایل را تنظیم کرده بود، احتمالاً فکر می‌کرد با این کار می‌تواند جلوی خزش لینک‌ های خروجی یا پلتفرم‌ های واسط را بگیرد.

اما این یک خطای نگارشی خنده‌ دار در سئو است!

قانون طلایی که هر متخصص سئویی باید بدانید این است: فایل robots.txt هر سایت، فقط و فقط برای مدیریت دسترسی ربات‌ها به مسیرهای داخلی همان دامنه است.

شما به هیچ وجه نمی‌توانید دستورات دسترسی دامنه‌های خارجی مثل اینماد (enamad.ir) یا ساماندهی را در فایل رباتزِ سایت خودتان تعیین کنید!

این خطوط عملاً دیتای زباله (Garbage) بودند که هیچ کارایی فنی نداشتند و فقط باعث سردرگمی بیشتر کراولر های گوگل موقع خواندن قوانین سایت می‌شدند؛

در نتیجه در نسخه جدید همه آن‌ها را کاملاً پاکسازی کردیم.

مهاجرت به سمت محتوای خوشه‌ای و کاربردی

برای حل مشکل وبلاگ، تمام مقالات کپی، کوتاه و بی‌ کیفیت را تعیین تکلیف کردیم. به جای تولید انبوه محتوای بی‌ ارزش، استراتژی محتوای خوشه‌ای (Topic Cluster) را حول نیازهای واقعی کاربران چیدیم.

مقالاتی کاملاً راهبردی و غنی با موضوعاتی مثل «نحوه آپلود فایل حجیم در پلتفرم‌ های داخلی» یا «بررسی امنیت در فضای ابری» تدوین شد و از درون آن‌ها با انکر تکست‌ های هدف، اعتبار به صفحه اصلی تزریق گردید.

درس بزرگی که این پروژه به ما داد

سئوی سایت‌های ابزاری و داینامیک، زمین بازیِ متفاوتی است.

در این سایت‌ها، کوچک‌ ترین تداخل میان کد های فرانت‌ اند و دسترسی‌های سرور می‌تواند بودجه خزش (Crawl Budget) شما را به باد بدهد و تمام زحمات تیم محتوا را نابود کند.

اگر شما هم مدیریت یک سایت ابزاری یا یک وبلاگ آسیب‌دیده را بر عهده دارید، همین امروز نگاهی به فایل رباتز و وضعیت خزش صفحات خود بیندازید؛ گاهی اوقات راه‌ حل بالا آمدن در نتایج، تولید محتوای بیشتر نیست، بلکه باز کردن درهای بسته‌ای است که خزنده‌های گوگل را پشت آن‌ها ناامید رها کرده‌ اید.

البته افت رتبه این سایت را می توان به آپدیت هسته گوگل هم دانست!

فاکتورهای حیاتی سئو در سایت‌ های آپلود فایل

فاکتور سئو چالش اصلی در سایت‌های آپلود فایل راهکار اصولی و بازگشت رتبه
مدیریت بودجه خزش (Crawl Budget) تولید روزانه هزاران یا میلیون‌ها یو‌آر‌ال داینامیک توسط کاربران که خزنده‌های گوگل را غرق می‌ کند. استفاده از هدر X-Robots-Tag (noindex) در سمت سرور و برگرداندن کد وضعیت 410 (Gone) برای فایل‌ های منقضی شده.
پیکربندی Robots.txt تداخل دستورات مسدود کننده با تگ‌ های نوآیندکس درون صفحه و ایجاد خطای همپوشانی در سرچ کنسول. باز گذاشتن موقت مسیر صفحات دانلود برای خوانده شدن تگ noindex توسط گوگل‌بات و حذف دیس‌ آلوهای اشتباه.
اعتبار موضوعی وبلاگ افتادن در دام صفحات یتیم (Orphan Pages) به دلیل بستن اشتباه دسته‌بندی‌ ها یا نوشتن مقالات کپی و بی‌کیفیت. پیاده‌سازی استراتژی محتوای خوشه‌ای (Topic Cluster) حول نیازهای دانلود/آپلود کاربران و باز کردن مسیر کامپوننت‌های اصلی وبلاگ.
پایداری سرور و دی‌ ان‌ اس (DNS) تعداد بالای درخواست‌ها به سرور دانلود که منجر به خطاهای سرور و بالا رفتن نرخ خطای مجاز (Fail Rate) در DNS resolution می‌شود. استفاده از شبکه توزیع محتوای پایدار (مانند کلودفلر) و تفکیک کامل سرور اصلی سایت از سرورهای فرعیِ نگه‌داری و دانلود فایل.
لینک‌ سازی داخلی شبکه‌ ای متمرکز ماندن تمام اعتبار سایت روی لینک‌های موقت کاربران به جای هدایت به لندینگ کلمات کلیدی اصلی. هدایت هوشمند اتوریتی از طریق پاهای وبلاگ و صفحات استاتیک با انکر تکست‌های «آپلود فایل» به صفحه اصلی دامنه.

 

0 پاسخ

دیدگاه خود را ثبت کنید

تمایل دارید در گفتگوها شرکت کنید؟
در گفتگو ها شرکت کنید.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *