文本嵌入与语义检索
把句子变成向量,按意思找最近的
语言与知识进阶 #09
输入文本表格
这项能力指什么
把一段文本编码成固定长度的向量,使语义相近的文本在向量空间中彼此靠近,再用最近邻查询取回相关条目。它以排序结果(条目 id 与分数)为输出,不生成自然语言。与「问答」的区别是它只负责「找出可能相关的材料」,不负责组织成答案。
技术上如何做到
主流用双塔结构:查询与文档分别经编码器压成向量,训练目标让真实配对得分高于随机负样本,常用对比学习与大批量负采样。检索时把全部文档向量预先算好放进向量索引,查询做近似最近邻搜索以在毫秒级返回 top-k。稀疏与稠密表示常混合使用,以兼顾关键词命中与语义召回。
代表产品
6相关机构
典型用途
- 企业文档与代码库检索
- RAG 流水线里的召回层
- 去重、聚类与主题发现
- 推荐与「相似内容」入口
怎么评价它好不好
- Recall@k
- 前 k 条里是否包含全部相关文档
- nDCG
- 考虑排序位置的折损累计增益
- MRR
- 第一条相关结果排名的倒数均值
边界与难点
- 语义相似不等于任务相关,向量近邻可能只是措辞相近
- 换领域或换语言时排序质量明显下降,需重新适配
- 长文档切块会切断上下文,块边界处的答案容易检索不到