被搜到 · 4 / 6

拆本站:Google 收錄 693 頁,Bing 只有 50 頁

前兩節的清單和槓桿,這一節全部落在一個真實病人身上:小山學堂自己。2026 年 8 月 10 日我們給全站做了一次 SEO / GEO 審計,查出十個缺口,當週修完一輪。這一節挑五個最有代表性的,每個講清怎麼發現的、改了什麼、拿什麼驗收。

真實案例收錄對比審計報告軟牆拆解
先交代病人的底子

審計那天的本站是這樣的:759 個 HTML 頁面,中英韓三語,絕大多數頁面有 description(743 頁)和 JSON-LD(741 頁)2026-08-10 實測。也就是説,上一節那張最低可行清單,它大部分是過關的。按很多教程的標準,這已經算「SEO 做得不錯的站」了。

但一做實測就露餡了。這正是本章反覆強調「自己動手核對」的原因:清單過了不代表沒病,數字才是診斷書。第一項實測就查出了全場最大的病。

動手 · 第一項實測:兩邊的收錄數

第 1 節教的三分鐘粗診,第一步就是 site: 查收錄。給本站跑這一步,結果如下。點按鈕跑一次。

site:xueai.miyang.cn 收錄數實測 2026-08-10 口徑
同一個站,同一天,兩個引擎
Google—
Bing—
差了將近 14 倍,而且短的那頭最要命。上一節埋的伏筆在這裏兑現:ChatGPT 的聯網搜索大量依賴 Bing 的索引。Bing 只認識你 50 頁,意味着不管另外 640 頁寫得多好,ChatGPT 替用戶搜的時候都翻不到它們。診斷結論:本站在 Google 眼裏是個內容站,在 ChatGPT 眼裏接近不存在。處方在下面的審計報告裏(缺口一)。

複盤這個病的成因很典型:站長平台只註冊了 Google,Bing 全靠自然爬。Google 的爬蟲勤快、配額大,慢慢也能爬全;Bing 對沒提交的小站爬得很保守。不是內容有差別,是你根本沒跟 Bing 打過招呼。

動手 · 審計報告板:五個缺口逐個拆

十個缺口裏挑五個最有教學價值的。每條點開,按「怎麼發現、改了什麼、拿什麼驗收」三段看。注意每條的「發現」都是一個可複製的動作,你可以原樣用在自己站上。

2026-08-10 審計報告(節選五條) 拆開 0 / 5
點一條展開一條
1Bing 收錄約 50 頁,Google 約 693 頁
發現兩個引擎各跑一次 site:xueai.miyang.cn,肉眼對比結果數。成本三十秒。
修法註冊 Bing Webmaster、提交 sitemap;接 IndexNow,發版腳本自動把變更頁面地址推給 Bing。第一次推送還吃了個 403,原因是 key 文件沒先放到站點根目錄,key 驗證通過後恢復正常。
驗收定的目標是兩週內 Bing 收錄從 50 到 300 以上,每週在站長後台記一次數。
2sitemap 漏了全部英文和韓文頁面,約 470 個地址
發現打開自己的 sitemap.xml 數條目:約 330 條,全是中文頁。但站上明明有 .en 和 .ko 頁面,它們全在靠外鏈隨緣被發現。英文內容恰恰是海外 AI 引擎引用的主要語言,等於把 GEO 的半張牌桌讓了。
修法改生成腳本:每個課程頁輸出中英韓三條 <url>,條目內用 hreflang 互指三個語言版本,引擎就知道它們是同一頁的翻譯,不會當成重複內容。
驗收sitemap 條目從約 330 漲到約 800,站長工具無格式報錯。
337 個天然 Q&A 頁只標了 Article,白扔 FAQ 引用
發現本站的小白三千問系列每頁就是一問一答(「Token 是什麼」「AI 客服為什麼蠢」),全是小白會原樣打進 AI 的問題。查 JSON-LD 卻只有 Article 類型,上一節講的 FAQPage 槓桿一個沒用上。
修法構建腳本對這批頁面額外注入 FAQPage:頁面標題當 Question,頁首答案塊的文本當 acceptedAnswer。全自動,不逐頁手寫。
驗收Google 富媒體測試通過;每月拿這批問題問一遍 Perplexity,記錄本站被引用的次數。
4JSON-LD 沒有日期,AI 引擎判斷不了新鮮度
發現抽查幾頁的 JSON-LD,datePublished 和 dateModified 都沒有。「2026 年學 AI 該從哪開始」這類問題,引擎會偏向能證明自己新鮮的內容。
修法日期不手填:腳本從 git 提交記錄取每頁的首次提交和最近內容提交,寫進 JSON-LD 並緩存,構建時批量注入。
驗收抽查十頁 schema 校驗通過,日期與 git 記錄一致。
5統計腳本把爬蟲流量全丟了,GEO 效果不可度量
發現流量統計腳本為了數字乾淨,把所有 bot 請求直接過濾掉。人的訪問是乾淨了,代價是 GPTBot 來沒來、來了抓什麼,一概不知道。改造做沒做進 AI 的索引,沒有任何儀表能看。
修法過濾改成歸檔:bot 請求單獨存,按 UA 統計 GPTBot、ClaudeBot、PerplexityBot、Bytespider 等的日抓取量和熱門路徑,後台加一張「AI 抓取」表。
驗收後台能看到各 AI 爬蟲近 7 天的抓取曲綫。上一節説的「GEO 儀表盤」,就是這張表。
五條拆完,注意一個共性:每條的修法都進了腳本和流程,沒有一條靠手工。一個人維護幾百個頁面,手工必漏;讓構建腳本每次發版自動做對,才是一人公司的 SEO 姿勢。
動手 · 軟牆:付費內容怎麼既讓爬蟲看見又不白送

本站有個繞不開的矛盾:五百多個頁面(含英韓版)要登入才能看,但整頁攔住的話,引擎和 AI 也一個字都抓不到。審計前的做法就是這樣的「硬牆」,531 個受限頁對引擎完全不可見。改造後換成「軟牆」。切換看兩種牆下,用戶和爬蟲各自看到什麼。

硬牆 vs 軟牆 切一切
未登入用戶看到的
xueai.miyang.cn/slides/agent-3.html
爬蟲抓到的源碼(節選)

軟牆和騙引擎的 cloaking 只隔一層紙,隔開它們的是那行 isAccessibleForFree: false 聲明:在 JSON-LD 裏明説「這頁有付費部分,受限範圍在哪」,這是 Google 官方認可的做法(Flexible Sampling)。刪掉聲明、給引擎全文卻給用戶空頁,就滑進違規了。改完的結果:531 個受限頁全文可抓,可索引頁從 28 漲到 186,再到審計後的全量2026-08 改造記錄。

動手 · 改造前後,六張牌翻一翻

整輪改造的成績單收在六張牌裏,點一張翻一張。左上角第一張是最重要的提醒:有些數字改造當天不會動,要等引擎消化。

改造前 → 改造後 翻開 0 / 6
數字口徑:2026-08-10 審計與當週改造記錄
sitemap 條目
~330 條
漏掉全部英韓頁
llms.txt 體系
僅目錄
沒有全文版
Q&A 結構化數據
0 頁
全標成普通文章
新鮮度信號
無
引擎判斷不了時效
AI 爬蟲監控
全丟棄
GEO 效果盲飛
Bing 收錄
~50 頁
改造當天不會變
注意最後一張牌的誠實:Bing 收錄數在改造當天一頁都不會多。SEO 和 GEO 的動作是當天做完的,效果是按周計的。所以驗收標準裏才全是「兩週內」「每週記一次」這種帶時間的寫法,當天出效果的 SEO,多半是騙子。

六張牌背後的工作量交代一下:審計半天,改造集中在一週內完成,絕大部分是改一個構建腳本。一個人、一週、幾乎零現金成本,這就是把動作全部腳本化之後,SEO / GEO 對一人公司的真實價格。

照抄清單 · 給自己的站做同款審計

這輪審計用到的動作全部可以照抄,一個下午能跑完。按順序來:

  1. Google 和 Bing 各跑一次 site: 查詢,兩個數記進台帳,差距大就知道該先補哪家。
  2. 打開自己的 sitemap.xml 數條目,和實際頁面數對一對,缺的就是引擎不知道的。
  3. 隨機抽五頁看源碼:正文在不在、description 有沒有、canonical 對不對、JSON-LD 帶不帶日期。
  4. 找出站上所有一問一答形態的頁面,查它們標沒標 FAQPage。
  5. 翻請求日誌搜 GPTBot,搜不到就查是不是被統計腳本或防火牆丟棄了。
  6. 有付費內容的話,用爬蟲視角(curl 或站長工具的抓取測試)看受限頁,確認引擎抓到的和用戶看到的是同一份內容。

每查一項記一行:現狀、影響、修法。查完你手裏就是自己站的這份審計報告。

整輪改造的節奏表

最後交代這輪改造的排期,供你安排自己的版本時參考。核心原則:按「引擎根本看不到」「看到了但不引用」「放大與防守」三層排優先級,每層做完再做下一層。

階段做什麼為什麼排這個位置
第 1 周sitemap 補多語言、llms-full.txt、補齊缺失的 description、註冊站長平台並提交全是「看不到」級別的病,不修的話後面做什麼都白做。三項改的是同一個構建腳本,一次發版
第 2 周FAQPage 結構化數據、JSON-LD 日期、爬蟲監控面板「看到了但不引用」層。監控面板要早於內容動作上綫,否則後面的效果沒儀表可看
第 3~4 周全站一句話答案塊唯一以周計的內容工作量:幾百頁的摘要句由 AI 批量起草、人工過一遍。放最後是因為它慢,不是因為它不重要
每週例行記錄收錄數、看爬蟲曲綫、看 AI 來源 referrer改造是一次性的,度量是長期的。數字進台帳,帶日期

注意第一週三件事擠在一起的原因:它們改的是同一個構建腳本。一個人做優化,按「改哪個文件」分組排期,比按「哪個更重要」排期省一半力氣,這是工程直覺在 SEO 上的應用。

改完拿什麼持續驗收 · 第 6 節這輪改造的驗收標準沉澱成了 12 項清單和四個度量口徑,每次上綫都能複用。
考一下 · 合規的邊界在哪
下面邊種做法越咗軟牆嘅合規綫? 單選
軟牆和作弊只隔一層紙,這道題就是那層紙
A全文進 HTML,未登入用戶見前 40%,JSON-LD 聲明受限範圍
B識別爬蟲 UA 時返回全文,普通用戶訪問時整頁只有登入框,頁面不做任何聲明
C免費頁全文開放,付費頁只把預覽段放進 llms-full.txt 並註明「全文見連結」
D給 locked.html 提示頁加 noindex,不讓它佔收錄坑位
本節要點
✓

清單過了不代表沒病:本站 759 頁裏 743 頁有 description,看着健康,一實測 Bing 收錄只有 50 頁。數字才是診斷書。

✓

每個缺口都要配「怎麼發現、改了什麼、拿什麼驗收」:發現要可複製,修法要進腳本,驗收要帶時間和數字。

✓

軟牆靠聲明合規:付費內容全文進 HTML 讓引擎可抓,用 isAccessibleForFree 聲明受限範圍。刪了聲明就從優化滑進作弊。

✓

效果按周計:動作當天做完,收錄數、引用率要等引擎消化。驗收全部寫成帶日期的目標,當天見效的承諾別信。

✓

按「改哪個文件」分組排期:一個人做優化,同一個腳本裏的改動擠進同一周,一次發版全上。

內容來源:本站 2026 年 8 月 10 日 SEO / GEO 審計與當週改造的第一手記錄。文中全部數字(Google 約 693 頁 / Bing 約 50 頁、sitemap 約 330 → 約 800 條、743/759 頁有 description、531 個受限頁、37 個 Q&A 頁、317 節 llms.txt)均為 2026-08-10 實測口徑,收錄數會隨時間變化,方法不會。