SEO 教學第 5 章

搜尋引擎如何運作?——檢索、索引、排名三階段完整解析

Crawl → Index → Rank。爬蟲抓網頁 → 存入索引資料庫 → 演算法排順序。SEO 就係圍繞呢三個環節做優化。

搜尋引擎如何運作?——檢索、索引、排名三階段完整解析

一句話講晒

Crawl → Index → Rank。爬蟲抓網頁 → 存入索引資料庫 → 演算法排順序。SEO 就係圍繞呢三個環節做優化。

呢個流程喺香港同喺全世界都一樣 —— Google 喺香港市佔超過 92%,用嘅係同一套系統。所以我哋要理解嘅原理唔會因為地區而變,變嘅只係「邊啲網站同平台值得你去優化」。


為什麼要搞懂搜尋引擎運作原理?

做 SEO 最忌「知其然而不知其所以然」。如果你不理解 Google 是怎麼「看到」你的網站、怎麼「理解」你的內容、怎麼「決定」你的排名,你的所有優化動作都可能只是猜測。理解運作原理,你才能:

  • 判斷「為什麼我的新頁面還沒被收錄」
  • 診斷「為什麼改了內容排名沒變」
  • 避開「做了優化反而排名下降」的陷阱

香港場景:一間銅鑼灣嘅餐廳整咗個新網站,三個月都無人搵到。通常唔係「Google 唔鍾意你」,而係 Catch 咗某一個環節:可能 robots.txt 擋咗爬蟲(檢索失敗)、可能得三頁內容全部係餐牌相(索引失敗)、也可能內容同「銅鑼灣 餐廳 推介」呢個查詢嘅意圖唔夾(排名失敗)。搞清楚係邊一環出事,先至有得醫。


第一階段:檢索(Crawling)——Google 如何「發現」你的網站

爬蟲的運作方式

Google 使用一個名為 Googlebot 的自動化程式(爬蟲),它像一個不知疲倦的圖書管理員,24 小時不停地在網路上「逛網站」。爬蟲的工作流程是:

起點 URL → 下載頁面 → 解析頁面中的所有連結 → 將新連結加入待抓取佇列 → 重複循環

爬蟲如何發現新頁面?

  1. 從已知 URL 出發:Google 維護著一個龐大的已知網址清單
  2. 透過連結發現:當爬蟲訪問一個頁面時,會抓取頁面中的所有超連結,加入待抓取清單
  3. 透過 Sitemap:網站主動提交 XML 網站地圖,告訴 Google 所有頁面的位置
  4. 透過 URL 提交:在 Google Search Console 中手動提交個別網址

香港額外提示:除咗 GSC,記得順手將 sitemap 提交去 Bing Webmaster Tools。原因有兩個:(一)Yahoo 香港(hk.yahoo.com)搜尋係用 Bing 技術,香港仍有約 3-6% 份額;(二)ChatGPT 同 Microsoft Copilot 會引用 Bing 嘅索引。成本近乎零,但覆蓋多一個入口。

影響檢索效率的關鍵因素

因素 說明 優化建議
檢索預算(Crawl Budget) Google 分配給每個網站的爬取資源是有限的 避免大量低質量頁面浪費預算
網站速度 爬蟲也受頁面載入速度影響 優化伺服器回應時間和頁面載入速度;香港網站建議用亞洲區(香港 / 新加坡)CDN 節點
內部連結結構 良好的內部連結幫助爬蟲發現更多頁面 確保每個重要頁面都有內部連結指向
Robots.txt 設定 錯誤設定可能阻止爬蟲訪問重要頁面 定期檢查 robots.txt,不要誤擋關鍵資源
JavaScript 渲染 依賴 JS 動態生成的內容可能無法被爬蟲「看見」 使用 SSR(伺服器端渲染)或預渲染技術

檢索階段常見問題

  • 孤兒頁面(Orphan Page):沒有任何內部連結指向的頁面,爬蟲幾乎不可能發現(例如一間香港網店上咗新產品,但無喺分類頁或任何文章入面連結過去)
  • 深層頁面:需要點擊多次才能到達的頁面,爬蟲可能不會爬那麼深
  • 無限空間頁面:如篩選器產生的大量 URL 變體,會浪費檢索預算(例如地產網嘅「地區 + 價錢 + 呎數 + 樓齡」篩選組合)

第二階段:索引(Indexing)——Google 如何「理解」你的網站

索引是什麼?

爬蟲抓取到頁面之後,Google 會對內容進行解析、分析、分類,然後存入一個巨大的資料庫——這就是「索引」。只有被成功索引的頁面,才有資格出現在搜尋結果中。

想像 Google 的索引是一間全世界最大的圖書館,每本「書」(網頁)都被分類、貼上標籤、建立摘要,當有人來查資料時,圖書管理員(搜尋引擎)就能快速從索引中找到相關的書。

索引過程中的關鍵步驟

  1. 內容解析(Parsing)

    • 解析 HTML 結構
    • 提取文字內容
    • 識別圖片、影片等多媒體(透過 alt text)
    • 執行並解析 JavaScript(如有)
  2. 內容理解(Understanding)

    • 判斷頁面語言(香港網站常見繁中、英文,甚至中英夾雜 —— 要用 hreflang 同清晰語言標記)
    • 識別核心主題和子主題
    • 分析內容品質與原創性
    • 理解實體(人物、地點、事物)之間的關係;例如「中環」「IFC」「香港站」呢啲香港地標會被當成實體去理解
  3. 訊號提取(Signal Extraction)

    • 頁面速度
    • 行動裝置相容性
    • HTTPS 安全狀態
    • 結構化資料
  4. 分類與儲存

    • 將頁面歸入相關主題類別
    • 儲存到分散式索引資料庫

為什麼頁面沒有被索引?

原因 診斷方式
Noindex 標籤 檢查頁面 <head> 中是否有 <meta name="robots" content="noindex">
Canonical 指向其他頁面 檢查 canonical 標籤是否正確
內容質量過低 Google 判斷為「低品質」或「薄內容」
重複內容 多個頁面內容高度相似(香港常見:連鎖集團每間分行頁面內容完全一樣,只改地區名)
Robots.txt 阻擋 檢查 robots.txt 是否阻擋了該 URL
伺服器問題 檢查頁面是否返回 4xx 或 5xx 狀態碼
新網站信號不足 新成立的網站需要時間建立信任

**「已檢索但未索引」**是 Google Search Console 中最常見的問題之一。大部分情況代表 Google 認為該頁面不值得被索引——需要檢查內容品質和獨特性。香港網站最常見嘅成因:分店頁/地區頁只係換咗地區名,其他內容一式一樣。


第三階段:排名(Ranking)——Google 如何「排序」你的網站

排名的本質

當用戶輸入查詢詞,Google 會在不到一秒鐘的時間內,從數十億個已索引頁面中,選出最相關、最有用的結果,並按照相關性排序。這個過程涉及 超過 200 個排名因素

什麼是演算法?

演算法不是一本「食譜」——你無法照著步驟做就保證排第一。它更像一個動態的評分系統

排名分數 = 相關性分數 × 權威性分數 × 用戶體驗分數 × 其他信號

核心排名因素解析

A. 相關性(Relevance)

子因素 影響方式
關鍵字匹配 頁面內容是否包含用戶搜尋的詞彙及其語意相關詞(香港用家常用廣東話口語,例如「邊間好」要對應「推介 / 推薦」呢類寫法)
內容深度 是否完整涵蓋主題的各個面向
內容新鮮度 資訊是否最新(特別是新聞、時事類查詢)
搜尋意圖匹配 內容類型(資訊型/交易型)是否與用戶意圖相符
結構化資料 Schema 標記是否能幫助搜尋引擎理解內容
地區相關性 本地搜尋時,你的商家 / 內容是否與搜尋者的地區(如沙田、將軍澳)相關;本地 SEO 會睇 GBP、NAP 一致性

B. 權威性(Authority)

子因素 影響方式
反向連結數量 有多少外部網站連結到你的頁面
反向連結品質 這些連結來自高權重的網站還是垃圾網站
連結相關性 連結來源網站的內容是否與你的頁面主題相關
E-E-A-T 信號 作者背景、網站聲譽、內容準確性
本地權威 喺香港本地平台嘅曝光:OpenRice(餐飲)、LIHKG / Uwants(討論)、香港01 / 經濟日報(媒體)、HKTDC / 商會目錄(B2B)

C. 用戶體驗(User Experience)

子因素 影響方式
Core Web Vitals LCP、INP、CLS 三個核心指標
行動裝置友善 在手機上的顯示和操作體驗(香港流動上網比例極高,呢項近乎生死線)
HTTPS 網站是否使用安全連線
沒有侵入式插頁廣告 彈出式廣告是否影響閱讀
頁面載入速度 整體載入時間

D. 用戶互動信號(User Interaction Signals)

子因素 影響方式
點擊率(CTR) 在 SERP 中被點擊的比例
停留時間(Dwell Time) 用戶點擊後停留在頁面上的時間
跳出率(Bounce Rate) 用戶是否只瀏覽一個頁面就返回搜尋結果
Pogosticking 用戶在搜尋結果和不同頁面之間來回跳轉

三階段示意圖

┌──────────┐    ┌──────────┐    ┌──────────┐
│  Crawl   │───▶│  Index   │───▶│  Rank    │
│  檢索     │    │  索引     │    │  排名     │
└──────────┘    └──────────┘    └──────────┘
     │               │               │
     ▼               ▼               ▼
 爬蟲訪問網頁    內容存入資料庫    演算法排序
 發現新 URL      解析與分類       回傳 SERP
 跟隨連結        提取信號         給用戶

SEO 實戰對照:每個階段你該做什麼

階段 你該做什麼 對應工具
檢索 提交 Sitemap、優化內部連結、確保 robots.txt 正確、加快頁面速度 GSC、Bing Webmaster Tools、Screaming Frog
索引 提交 URL 至 GSC、避免 noindex 誤用、處理 canonical 問題、消滅重複內容 GSC 涵蓋範圍報告
排名 關鍵字策略、內容優化、建立反向連結、改善 Core Web Vitals Ahrefs、SEMrush、Lighthouse

香港本地加分項:排名階段除咗自己個網站,仲有兩個「外部版面」要顧 ——

  1. Google 商家檔案(GBP):香港完全可用,對餐廳、補習社、地產代理、診所、律師樓係本地 SEO 基石;地址要寫足「街道 + 大廈 + 室號 + 地區」。
  2. 本地引用平台:OpenRice、TripAdvisor、Facebook 專頁、香港旅發局、HKTDC、各區商會目錄。呢啲平台本身喺 Google 有高權威,佢哋排到第一頁,就等於你間接曝光。

重點回顧

  1. Crawl → Index → Rank:記住這三個階段,每個 SEO 問題都能歸類到其中一個環節
  2. 檢索是前提:如果爬蟲根本找不到你的頁面,後面的優化都沒有意義(香港網站記得同時提交 GSC + Bing Webmaster Tools)
  3. 索引是門檻:被「檢索」不代表被「索引」,低品質內容會被 Google 拒絕收錄;分店頁 / 地區頁互相複製係香港常見地雷
  4. 排名是結果:超過 200 個因素共同決定排名,沒有單一魔法按鈕;本地生意要額外顧及 GBP 同本地引用
  5. 用戶才是最終裁判:所有演算法的最終目標都是服務用戶,創造好內容才是根本

上一章:第 4 章 | 回索引 | 下一章:第 6 章