你可能会说
这个 AI 功能涉及到向量嵌入,帮我理解一下然后集成进去。
把文字变成一串数字(向量),意思相近的文字在数字空间里距离也近。
把文字变成一串数字(向量),意思相近的文字在数字空间里距离也近。这样计算机就能「理解」语义相似度。
生活类比
像给每个词一个 GPS 坐标——「苹果」和「水果」的坐标很近,和「汽车」的坐标很远。
🎮 动手试试
关于「向量嵌入」,以下哪个描述最准确?
你可以这样告诉 AI
帮我用 embedding 做一个相似文章推荐功能:把每篇文章转成向量存起来,用户看一篇就推荐向量距离最近的 5 篇。
分词是把文字切成最小单元(Token),Embedding 是把这些 Token 变成数字向量。先分词再嵌入,两步走。
语义搜索
想让用户用自然语言搜索产品(如「适合送礼的护肤品」),用 embedding 做语义匹配比关键词搜索准确得多。
和 AI 协作时
告诉 AI「帮我用 embedding 做相似文章推荐:把文章转成向量存数据库,用户读一篇后推荐距离最近的 5 篇」。
精确匹配查询
按订单号查物流、按手机号查用户这类精确查询,用传统数据库索引即可,embedding 反而降低精度。
纯静态展示网站
企业官网、落地页等不需要搜索和推荐功能的项目,用不到 embedding。
把文字变成一串数字(向量),意思相近的文字在数字空间里距离也近。这样计算机就能「理解」语义相似度。
像给每个词一个 GPS 坐标——「苹果」和「水果」的坐标很近,和「汽车」的坐标很远。
做语义搜索、RAG 时,底层就是在比较向量的距离。