GeoCheck GEO(生成式引擎優化)產品與方法論白皮書
從黑盒猜測走向可觀測證據:AI 信任值、量測架構與透明度指南
以客觀可觀測的公開 AI 輸出為基礎,結合「行為端回答採用」與「結構端官方引用」,拒絕黑盒盲猜與虛假排名承諾。
重要聲明與研究邊界
- 非商業成效保證:GeoCheck 量測的是特定條件下「可觀測的搜尋與引用證據」,絕不承諾或保證任何搜尋引擎或 AI 平台的特定排名、推薦率、點擊流量、獲客量或營收轉換。
- 非模型內部認知:產品指標「AI 信任值」(AI Trust Index)為系統量測「AI 在公開回答中採用品牌」與「引用第一方官方來源」之客觀證據率,不代表大型語言模型(LLM)內部神經網路的實際信念或真實偏好。
- 未知不等於零:平台服務中斷、網路逾時、API 拒答或無法解析之回答,均歸類為「未知(unknown)」,一律排除於計分分母之外,絕不假定為「表現為 0 分」。
1. 緒論:為什麼需要可觀測的 GEO 方法論?
1.1 從傳統 SEO 到 GEO(生成式引擎優化)
傳統搜尋引擎(如 Google、Bing)的核心是「排序藍色連結(Ranked Blue Links)」,其評估體系以關鍵字排名、展示次數(Impressions)與點擊率(CTR)為中心。
生成式 AI 搜尋(如 Perplexity、ChatGPT Search、Google AI Overviews)改變了答案的呈現方式:AI 直接生成綜合解答,而非僅列出網頁清單。
在生成式對話情境中,品牌面臨全新的曝光型態:
- 答案採用(Answer Adoption):AI 在推薦解決方案或回答知識性問題時,是否主動提及該品牌?
- 來源背書(Source Attribution):AI 在正文下方或內文中,是否標註並引用該品牌的官方網頁作為證據來源?
1.2 當前市場痛點:黑盒巫術與過度承諾
當前市場對 GEO 充滿焦慮與投機,常見問題包括:
- 虛假因果承諾:宣稱「填寫特定 Schema 標籤或改寫內容,即可 100% 登上 AI 推薦第一名」。事實上,生成式引擎具備隨機取樣(Temperature > 0)與即時 RAG 動態重排序特性,不存在確定性的排名保證。
- 混淆指標與構念:將網站內部的技術分數(例如 HTML 結構、結構化資料完整度)直接混充為「AI 已經喜愛並推薦你的網站」。
- 無效填補與偏誤:測試 API 一旦拒答或連線失敗,許多工具直接把該次查詢記為 0 分,等於把「沒拿到資料」誤判成「品牌表現為零」。
2. 量測架構:三權分立的指標體系
為避免單一綜合分數遮蔽事實,GeoCheck 確立了「三權分立」的架構原則:
1. 產品核心指標:AI 信任值
- 答案採用率 (65%)
- 官網引用率 (35%)
- 有效查詢數不足封頂 (69分)
- 排除未回應題目 (標記為未知)
2. 研究基石層:GEO Core
- 原始 Query-Run 執行次數紀錄
- 完整 Prompt 與 Answer 生成存檔
- 第一方來源 URL 與網域判定
- 實體對齊路徑與拒答紀錄
3. 輔助技術診斷:網站技術準備度
200 / 301 重定向與伺服器回傳
搜尋與 AI 爬蟲存取規則
Organization / Schema 實體對齊
H1–H3 階層與可閱讀內文深度
3. 單站產品檢測流程:動態發現與即時分析
單站檢測適用於一般使用者在首頁輸入單一網址後的即時檢測。核心流程包括:
- 多重抓取彈性保障:優先以輕量 HTTP 抓取目標頁面 HTML;遇客戶端渲染自動退回 Headless 瀏覽器渲染模式。
- 非品牌題目生成與防呆:使用結構化 LLM(現行主力:
deepseek-v4-flash)依頁面證據產出 5~8 個候選題,並以確定性正規表示式嚴格剔除包含受測品牌的題目。若兩輪無法湊齊可選出 4 題的合規非品牌題,系統主動停止搜尋並標示unknown。 - 實體查詢隔離:額外執行 1 次帶品牌名稱的實體查詢(Direct Entity Query),但僅用於綁定官方別名與網域,不併入非品牌發現的評分分母中。
4. 白皮書研究批次流程:凍結題組與嚴謹母體
當進行跨品牌、跨產業的基準調查或研究白皮書時,嚴禁使用單站檢測的動態題目。批次研究恪守以下原則:
- 受控題組(Frozen Query Set):全體受測樣本面對完全相同的提示詞(Prompts)。題目一旦審定封存,不可事後調整以迎合特定品牌。
- 實體主檔鎖定(Entity Master Lock):在啟動 API 批量測試前,必須完成人工實體主檔審查,明確定義品牌正式名稱、已知別名、官方主網域與專屬路徑。
- Preflight 覆蓋防護:執行前進行程式化預檢。凡有未對齊實體或母體定義模糊者,系統直接阻擋執行。
- 禁止靜默備援(No Silent Fallback):研究批次中,搜尋供應商若連線中斷,一律記為失敗,禁止自動切換至其他模型,確保樣本處於同一模型基準線。
5. 指標解讀:AI 信任值與評分規則
在經審定的非品牌發現查詢集中,針對所有取得有效且可見回答的執行次數(\(N_{\text{valid}}\)),「AI 信任值」定義如下:
$$\text{答案採用率} = \frac{\sum \text{提及已對齊品牌之有效查詢數}}{N_{\text{valid}}}$$
$$\text{來源證據率} = \frac{\sum \text{引用經核實第一方官方 URL 之有效查詢數}}{N_{\text{valid}}}$$
樣本不足封頂防呆(Coverage Cap at 69 分):單次偶發的成功無法代表穩定的市場能見度。若受測網站有效查詢次數 \(N_{\text{valid}} < 2\),前端產品顯示分數嚴格封頂於 69 分,防止單一題目偶然被提及時產生虛假的滿分誤導。
6. 證據判定:答案採用 vs. 來源證據四象限
GeoCheck 將 AI 的輸出嚴格拆解為兩個獨立維度:答案層是否提及品牌(65%)、來源層是否引用官方網域(35%)。
7. 網站技術準備度:基礎建設與非因果限制
網站技術準備度量測網站的機器可讀性(HTTP 存取性、Robots、Sitemap、Schema.org JSON-LD 與內容密度)。
結構化資料與機器存取性是 AI 能順暢檢索網頁的「必要條件(Prerequisite)」,但絕非「充分保證(Guarantee)」。技術準備度獨立診斷,不計入 AI 信任值總分。
8. 研究限制與治理規範
- 時間波動性(Temporal Drift):生成式搜尋每週微調模型或更新索引。量測結果代表特定時點的可觀測狀態,不代表永久排名。
- 單一引擎限制:本系統搜尋觀測主力為 Perplexity Sonar 系列,不可直接外推至所有 AI 模型。
- 探索性相關分析:若探討 AI 信任值與客流量關係,嚴格定性為探索性相關,嚴禁宣稱因果關係。
- L2 可複現性承諾:演算法全公開、資料集計算 SHA-256 雜湊值防竄改、完整揭露 Unknown 與失敗記錄。