Embedding 是什么:文本是怎么变成向量的

搜索、推荐、RAG 的底层都靠 Embedding。它把文字变成一串数字,让机器"读懂"语义。一文看懂。

Embedding 是什么:文本是怎么变成向量的

语义搜索、推荐系统、RAG 的底层,都离不开一个概念——Embedding(嵌入向量)。它是让机器"理解语义"的关键。本文讲清它是什么。

一、Embedding 是什么

简单说,就是把一段文字(或图片)变成一串数字(向量)。这串数字浓缩了它的"含义",让计算机可以对语义做计算。

二、神奇之处:含义相近,向量也相近

好的 Embedding 会让意思接近的内容,向量也接近。比如"猫"和"猫咪"的向量很近,"猫"和"汽车"就很远。于是"找语义相似的内容"变成了"找向量距离近的内容"——机器就能做了。

三、它能做什么

  • 语义搜索:搜"怎么减肥",也能匹配到"如何科学瘦身"。
  • RAG:把文档转成向量存库,按语义检索相关片段。
  • 推荐/聚类:找相似内容、给内容分组。

四、怎么得到 Embedding

用专门的 Embedding 模型(各家大模型厂商和开源社区都有),把文本传进去就返回一串向量。Embedding 模型的质量,直接决定检索和搜索的效果。

结语

Embedding 是 AI 理解语义的"通用语言"。理解了它,你就理解了语义搜索和 RAG 为什么能work——一切都建立在"把含义变成可计算的向量"之上。


相关阅读