跳到正文
AI 图鉴

文本嵌入与语义检索

把句子变成向量,按意思找最近的

语言与知识进阶 #09
输入文本表格

这项能力指什么

把一段文本编码成固定长度的向量,使语义相近的文本在向量空间中彼此靠近,再用最近邻查询取回相关条目。它以排序结果(条目 id 与分数)为输出,不生成自然语言。与「问答」的区别是它只负责「找出可能相关的材料」,不负责组织成答案。

技术上如何做到

主流用双塔结构:查询与文档分别经编码器压成向量,训练目标让真实配对得分高于随机负样本,常用对比学习与大批量负采样。检索时把全部文档向量预先算好放进向量索引,查询做近似最近邻搜索以在毫秒级返回 top-k。稀疏与稠密表示常混合使用,以兼顾关键词命中与语义召回。

代表产品

6

相关机构

典型用途

  • 企业文档与代码库检索
  • RAG 流水线里的召回层
  • 去重、聚类与主题发现
  • 推荐与「相似内容」入口

怎么评价它好不好

Recall@k
前 k 条里是否包含全部相关文档
nDCG
考虑排序位置的折损累计增益
MRR
第一条相关结果排名的倒数均值

边界与难点

  • 语义相似不等于任务相关,向量近邻可能只是措辞相近
  • 换领域或换语言时排序质量明显下降,需重新适配
  • 长文档切块会切断上下文,块边界处的答案容易检索不到

背后的概念