ทำความรู้จัก Web Crawler คืออะไร Google ส่งบอทมาอ่านเว็บเราอย่างไรให้ติดอันดับ
การสร้างเว็บไซต์ที่สวยงามและมีเนื้อหาครบถ้วนอาจกลายเป็นสิ่งที่สูญเปล่า หากไม่มีใครมองเห็นเว็บไซต์ของคุณบนหน้าผลการค้นหาของ Google เปรียบเสมือนการเปิดร้านอาหารรสเลิศในซอยลึกที่ไม่มีป้ายบอกทาง ลูกค้าขาจรย่อมไม่มีทางรู้ว่ามีร้านนี้ตั้งอยู่ เบื้องหลังการที่เว็บไซต์หนึ่งจะปรากฏขึ้นมาให้เราเห็นได้นั้น ไม่ได้เกิดขึ้นโดยบังเอิญ แต่เกิดจากการทำงานอย่างหนักของระบบอัตโนมัติที่เรียกว่า Web Crawler เจ้าเครื่องมือตัวนี้เปรียบเสมือนแมงมุมขยันที่คอยไต่ไปตามใยอินเทอร์เน็ตเพื่อเก็บข้อมูลเว็บไซต์ต่างๆ ทั่วโลกกลับไปเก็บไว้ในคลังข้อมูลของ Google หากเว็บไซต์ของคุณไม่เป็นมิตรกับเจ้าแมงมุมตัวนี้ โอกาสที่จะติดหน้าแรกก็แทบจะเป็นศูนย์ พี่แว่น อยากชวนเจ้าของธุรกิจและนักการตลาดทุกท่านมาทำความเข้าใจกลไกการทำงานของ Web Crawler เพื่อที่เราจะได้จัดเตรียมบ้านให้พร้อมต้อนรับแขกคนสำคัญรายนี้ และเปลี่ยนการเข้าชมของบอทให้กลายเป็นอันดับที่ดีขึ้นครับ Web Crawler คือนักสำรวจผู้ไม่เคยหลับใหลบนโลกอินเทอร์เน็ต Web Crawler (หรือบางครั้งเรียกว่า Spider หรือ Bot) คือโปรแกรมคอมพิวเตอร์อัตโนมัติที่ Search Engine อย่าง Google ส่งออกมาเพื่อสำรวจและรวบรวมข้อมูลจากเว็บไซต์ต่างๆ บนอินเทอร์เน็ต หน้าที่หลักของมันคือการ “Crawl” (คืบคลาน/สำรวจ) เพื่อค้นหาว่ามีหน้าเว็บใหม่อะไรเกิดขึ้นบ้าง หน้าเว็บเก่ามีการอัปเดตเนื้อหาหรือไม่ หรือมีหน้าไหนที่ถูกลบออกไปแล้ว Googlebot แขกคนสำคัญของคนทำเว็บ สำหรับ Google ตัว Web Crawler ที่เราคุ้นเคยกันดีมีชื่อว่า Googlebot โดยแบ่งการทำงานหลักๆ เป็นสองส่วนคือ Crawling การวิ่งเข้าไปในเว็บไซต์เพื่ออ่านโค้ดและเนื้อหา Indexing การนำข้อมูลที่อ่านได้ไปจัดเก็บในดัชนี (Index) เพื่อรอการนำมาแสดงผลเมื่อมีคนค้นหา หาก Googlebot เข้ามาอ่านเว็บคุณไม่ได้ หรืออ่านแล้วไม่เข้าใจ เว็บไซต์ของคุณก็จะไม่มีวันถูกบรรจุลงในฐานข้อมูล และไม่มีทางปรากฏบนหน้า Search Result Page (SERP) ได้เลย บอทเดินทางด้วยเส้นทางของลิงก์ภายในเป็นหลัก หลายคนสงสัยว่า Googlebot รู้ได้อย่างไรว่าต้องไปหน้าไหนต่อ คำตอบคือบอทเดินทางผ่าน Link (ลิงก์) ครับ โดยเฉพาะ Internal Link หรือลิงก์ภายในเว็บไซต์ที่เชื่อมโยงระหว่างหน้าหนึ่งไปยังอีกหน้าหนึ่ง การทำงานเปรียบเสมือนใยแมงมุม เมื่อบอทเข้ามาที่ “หน้าแรก” (Homepage) ของคุณ มันจะเริ่มสแกนหาลิงก์ทั้งหมดที่มีอยู่ในหน้านั้น หากคุณมีลิงก์ไปยัง “หน้าสินค้า” บอทก็จะไต่ตามลิงก์นั้นไปเก็บข้อมูลหน้าสินค้า หากหน้าสินค้ามีลิงก์ไปยัง “บทความที่เกี่ยวข้อง” บอทก็จะไต่ต่อไปเรื่อยๆ ระวัง…
