AI Capabilities Lesson 7|實作練習:看懂 Embedding 向量與語意搜尋

AI Capabilities Lesson 7|實作練習:看懂 Embedding 向量與語意搜尋

📚 AI Capabilities and Limitations 學習筆記系列
Lesson 7 / 14 ・ 課程進度 50%
L6
知識
L7
實作練習
L8
工作記憶
📌 這篇文章談什麼?

這是「知識」特性的實作課。上一課說檢索(RAG)可以補模型的知識洞,這一課打開引擎蓋看它怎麼運作。官方互動「視覺化 1024 維空間」用一個絕妙的例子帶你理解 Embedding(嵌入向量):把恐龍童書、雲霄飛車網頁、百科全書畫在座標圖上,你會親眼看到——「意義」可以變成「位置」,而搜尋就是找出最近的鄰居。玩完之後,語意搜尋、向量資料庫、餘弦相似度這些名詞會從黑話變成常識。

課程單元Lesson 7|Try It Out: Knowledge
預估時間約 20–30 分鐘(互動實作)
課型🛠 實作練習(Try it out)——建議搭配官方互動頁一起玩
官方單元連結Try it out: Visualizing 1024D Space(英文互動頁)

字串搜尋的困境

搜尋「car」,你會找到每一份含有「car」這個字的文件——但找不到「automobile」,找不到「vehicle」,更找不到「我的 Civic 該換煞車了」。

幾十年來,搜尋就是這樣:比對字串,而不是比對意義。Google 靠工程手段一點一點補:同義詞字典把 car 對到 automobile、詞幹規則把 running 連到 run、點擊模式挖掘發現搜「NYC apartments」的人要的和「Manhattan rentals」一樣⋯⋯字串之間的連結,幾乎得靠人工一條一條建

💡 Embedding 顛覆了這一切,靠的是一個想法:意義可以是一個「位置」。把文字轉成座標,相近的概念就會落在相近的地方——而且這張語意地圖不是人工畫的,是從訓練資料中自己長出來的

第一步:編碼(Encoding)——把意義畫在座標上

從一個簡化的例子開始。想像你替語料庫裡的每份文件打兩個分數:「跟恐龍多有關?」和「跟雲霄飛車多有關?」主題相近的文件,自然會落在相近的位置。官方給了三個來源讓你親手擺放:

🦕 🎢 📚 很有關 ↑ 無關 很有關 →
↑ 縱軸:跟雲霄飛車多有關? 橫軸:跟恐龍多有關? →
  • 🦕 恐龍童書:恐龍指數爆表、雲霄飛車幾乎為零 → 右下角
  • 🎢 Velocicoaster 網頁(環球影城的侏羅紀主題雲霄飛車):雲霄飛車拉滿、恐龍中等 → 上方偏中
  • 📚 整套百科全書:兩個主題都「涵蓋一些」 → 卡在中間(官方座標:63%, 35%)

恭喜——你剛剛在 2D 空間裡完成了「意義的地圖」:物件的位置,由它「在講什麼」決定。

第二步:檢索(Retrieval)——把問題也畫上去

現在來搜尋這個空間。訣竅只有一句話:用同一套邏輯、同一組軸,把「問題」也畫到圖上。

問題是:❓「最棒的恐龍主題雲霄飛車是哪個?」——恐龍指數高、雲霄飛車指數也高,落點在右上區(看上面圖中的 ❓)。接著找出離它最近的 k 個項目:最近的是 🎢 Velocicoaster 網頁,再來可能是 🦕 或 📚。官方互動頁還有一支滑桿讓你調整 k 值(要撈回幾筆)。

💡 這就是相似度搜尋(similarity search)的全部精髓:把問題畫上圖、找最近的 k 個鄰居。不靠關鍵字比對、不靠同義詞表——靠多維空間中的距離

第三步:更多維度——從 3D 到 1024D

兩條軸只能捕捉兩個概念,真實世界的主題遠不止兩個。官方先加第三軸「生物學」:童書得分高(物種、棲地、食性)、百科涵蓋一些、Velocicoaster 網頁幾乎沒提。每份文件從兩個座標變三個——Velocicoaster 網頁從 (0.50, 0.90) 變成 (0.50, 0.90, 0.05)。互動頁上這張 3D 圖可以拖曳旋轉。

然後試著想像第四條軸⋯⋯想不出來?沒關係,官方作者也想不出來 😔——而且這完全不重要。每加一個維度,只是每個點多一個座標、距離公式多一個平方項。空間想像在 4D 就失效了,但數學照常運作。

而真實的 Embedding 模型用的是大約一千個維度(官方範例用 VoyageAI 的模型,1,024 維)。每份文件、每個問題,都是那個千維空間裡的一個點。「找最近的文件」的意思和 2D 圖上完全一樣——只是距離算式長一點。

沒有名字的軸

剛剛的軸是我們選的:恐龍、雲霄飛車、生物學。那真實模型的 1,024 條軸是誰決定的?

沒有人決定。每條軸的意義是「湧現」的——訓練過程中自己冒出來的,而且是個黑盒子。你沒辦法指著第 847 維說「這是恐龍軸」;這些維度不對應任何人類叫得出名字的概念。這讓整個空間變得難以推理:我們無法質問第 847 維,來理解為什麼兩段文字靠得近、或為什麼預期相近的東西卻離得遠。

💡 眼熟嗎?這和 Lesson 5 的結論是同一筆交易:用可解釋性,換取能力。馬可夫鏈的查表看得懂但走不遠;湧現的千維空間走得遠,但看不懂。

文字變座標:Embedding 模型

那座標是誰算的?Embedding 模型。任何字串進去,固定長度的一串數字出來:

“work from home”
[0.23, -0.87, 0.41, …]
共 1,024 個數值
“員工每週可遠端工作最多兩天,須經主管核准。”
[0.71, 0.09, -0.33, …]
共 1,024 個數值

注意:輸出永遠等長——不管輸入是三個字還是三段話,出來都是 1,024 個數值。一段文字對應空間中的一個點;這串數字(術語叫向量)可以想成這段文字相對於其他所有文字的「地址」

相似度:餘弦相似度

2D 圖上的「最近」指直線距離;實務上,相似度搜尋改用餘弦相似度(cosine similarity)——比的是兩個向量指的方向有多接近,而不是兩點隔多遠。量尺長這樣:

-1 相反0 無關1 完全相同

官方互動頁的實測範例:🎢 Velocicoaster 網頁 × 📚 百科全書 ≈ 0.61(有點關係);試著比比看 🎢 × 🦕——兩個向量指向非常不同的方向。

官方的觀察很妙:百科全書和誰比都落在中間——樣樣通、樣樣鬆,它的向量就長那樣。

接回 Lesson 6:這就是 RAG 引擎蓋下的機器

現在把整條線接起來。Lesson 6 說:檢索(RAG)補知識洞的方法,是「先從你的資料撈出相關內容、再讓模型作答」。這一課回答了關鍵的技術問題——「相關」是怎麼判斷的?

  1. 你的每份文件先被 Embedding 模型轉成向量,存進向量資料庫
  2. 你的問題進來,也轉成向量
  3. 用餘弦相似度找最近的 k 份文件
  4. 把撈到的內容連同問題一起交給語言模型作答

所以語意搜尋能用「遠端工作規定」找到那條寫著「員工每週可遠端工作最多兩天」的政策——兩段文字沒有半個字相同,但它們的向量指著同一個方向。這就是意義變成位置的威力。

重點整理(Key Takeaways)

  • 傳統搜尋比對字串;Embedding 讓搜尋比對意義——把文字轉成座標,相近概念落在相近位置。
  • 相似度搜尋=把問題畫進同一個空間、找最近的 k 個鄰居。
  • 真實模型用約 1,024 維;空間想像在 4D 失效,但數學照常運作。
  • 軸的意義是湧現的、無人命名的——又一次「用可解釋性換能力」的交易。
  • 餘弦相似度比的是向量方向:-1 相反、0 無關、1 完全相同。
  • 這整套機器,就是 RAG 檢索判斷「相關」的方法——Lesson 6 的補洞機制,引擎蓋下長這樣。

動手做:官方互動頁任務清單

打開官方互動頁,把下面四關玩完:

☑️ 第一關|擺放來源:把恐龍童書、Velocicoaster 網頁、百科全書放到你認為對的位置。放完想一下:你剛剛用的判斷標準,就是「編碼」。

☑️ 第二關|檢索:把問題畫上圖,拉動 k 值滑桿從 1 調到 3,看撈回的來源怎麼變。想想:k 太小會漏掉什麼?k 太大會混進什麼?

☑️ 第三關|旋轉 3D:拖曳旋轉三維圖,找一個「兩個點看起來很近、轉個角度才發現很遠」的視角——體會為什麼維度不夠會誤判相似。

☑️ 第四關|比相似度:兩兩比較四個項目的餘弦相似度。先猜再看:哪一對最高?哪一對最低?百科全書是不是每一對都卡中間?

課後反思

  • 你工作中有哪些「用關鍵字搜不到、但意思明明相關」的搜尋痛點?現在你知道語意搜尋為什麼能解決它了嗎?
  • 「軸沒有名字」意味著檢索偶爾會撈回你意想不到的東西。這對你使用 RAG 類工具(讓 AI 讀你的文件庫)時的查證習慣,有什麼提醒?

下一課預告

知識講完了。下一個特性是官方口中「邊緣最鋒利」的一個:工作記憶(Working Memory)——AI 此刻正注意著什麼?上下文視窗如何運作?為什麼其他特性是漸變的坡,這一個卻是斷崖

← 上一課
Lesson 6|AI 的知識邊界
下一課 →
Lesson 8|工作記憶

延伸閱讀

常見問題 FAQ

Q1:什麼是 Embedding(嵌入向量)?

把一段文字轉成一串固定長度數字(向量)的技術。這串數字相當於這段文字在「語意空間」中的地址:意思相近的文字,地址也相近。不論輸入長短,輸出長度固定(例如 1,024 個數值)。

Q2:語意搜尋和關鍵字搜尋差在哪?

關鍵字搜尋比對字串,搜「car」找不到「automobile」;語意搜尋把問題和文件都轉成向量,比對的是意義的距離,所以字面完全不同、意思相關的內容也找得到。

Q3:餘弦相似度(cosine similarity)是什麼?

衡量兩段文字相似程度的指標,比的是兩個向量「指的方向」:1 代表完全相同、0 代表無關、-1 代表相反。實務上的相似度搜尋多用它,而非直線距離。

Q4:Embedding 跟 RAG 是什麼關係?

Embedding 是 RAG 的檢索引擎:文件庫先全部轉成向量存進向量資料庫,問題進來也轉成向量,用餘弦相似度找出最近的 k 份文件,再交給語言模型作答。RAG 之所以能判斷「相關」,靠的就是這套機制。

本文為 Anthropic 官方課程之中文學習筆記。原課程建立於 Prof. Rick Dakan(Ringling College of Art and Design)與 Prof. Joseph Feller(University College Cork)發展的 AI Fluency Framework 之上,以 CC BY-NC-SA 4.0 授權釋出。Copyright 2026 Anthropic.

📬 喜歡這篇文章?訂閱電子報不錯過任何更新

生成式 AI 時代,最珍貴的資產不是工具本身,而是你的提問力與協作思維。
每週精選 AI 實戰技巧、官方課程更新與 AI 工作流攻略,直接寄到你的信箱!

免費訂閱電子報 →

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *