创建时间: 2026-03-29最后更新: 2026-09-10作者: yangbo(9e98781e0)
1. 切分的作用
Agent 能读取当前对话,却不会自动知道公司制度、产品手册或用户上传的资料。要让这些外部知识参与回答,通常需要先完成一条知识准备流程:
code.ts
1读取原始资料2-> 整理为 Document3-> 切分为 Chunk4-> 生成 Embedding5-> 写入向量数据库6-> 根据问题检索相关 Chunk7-> 交给 Agent 回答
这类根据外部资料检索并生成答案的流程通常称为 RAG。本文只关注其中的文档整理和切分。
Chunk 是长文档切分后得到的文本片段。文档切分通常属于知识入库阶段,同一批资料不需要在 Agent 的每一轮问答中重新处理。只有文档新增、内容更新或切分策略变化时,才需要重新生成 Chunk 和索引。
正在加载图示...
切分需要在完整性和检索精度之间找到平衡:
- Chunk 太大时,多个主题可能混在一起,检索结果会包含较多无关内容
- Chunk 太小时,一条完整规则可能被拆散,模型只能看到结论的一部分
- Chunk 重叠太多时,相似片段会占用检索名额和模型上下文
切分的目标是让每个 Chunk 尽量包含一段可以独立理解的内容,而非机械地生成完全相同的长度。
正在验证登录状态
请稍候,验证完成后将继续显示文章内容