Embedding 是什么:文本是怎么变成向量的
搜索、推荐、RAG 的底层都靠 Embedding。它把文字变成一串数字,让机器"读懂"语义。一文看懂。
语义搜索、推荐系统、RAG 的底层,都离不开一个概念——Embedding(嵌入向量)。它是让机器"理解语义"的关键。本文讲清它是什么。
一、Embedding 是什么
简单说,就是把一段文字(或图片)变成一串数字(向量)。这串数字浓缩了它的"含义",让计算机可以对语义做计算。
二、神奇之处:含义相近,向量也相近
好的 Embedding 会让意思接近的内容,向量也接近。比如"猫"和"猫咪"的向量很近,"猫"和"汽车"就很远。于是"找语义相似的内容"变成了"找向量距离近的内容"——机器就能做了。
三、它能做什么
- 语义搜索:搜"怎么减肥",也能匹配到"如何科学瘦身"。
- RAG:把文档转成向量存库,按语义检索相关片段。
- 推荐/聚类:找相似内容、给内容分组。
四、怎么得到 Embedding
用专门的 Embedding 模型(各家大模型厂商和开源社区都有),把文本传进去就返回一串向量。Embedding 模型的质量,直接决定检索和搜索的效果。
结语
Embedding 是 AI 理解语义的"通用语言"。理解了它,你就理解了语义搜索和 RAG 为什么能work——一切都建立在"把含义变成可计算的向量"之上。