创建时间: 2026-03-29最后更新: 2026-09-10

1. 切分的作用

Agent 能读取当前对话,却不会自动知道公司制度、产品手册或用户上传的资料。要让这些外部知识参与回答,通常需要先完成一条知识准备流程:

code.ts
1
读取原始资料
2
-> 整理为 Document
3
-> 切分为 Chunk
4
-> 生成 Embedding
5
-> 写入向量数据库
6
-> 根据问题检索相关 Chunk
7
-> 交给 Agent 回答

这类根据外部资料检索并生成答案的流程通常称为 RAG。本文只关注其中的文档整理和切分。

Chunk 是长文档切分后得到的文本片段。文档切分通常属于知识入库阶段,同一批资料不需要在 Agent 的每一轮问答中重新处理。只有文档新增、内容更新或切分策略变化时,才需要重新生成 Chunk 和索引。

正在加载图示...

切分需要在完整性和检索精度之间找到平衡:

  • Chunk 太大时,多个主题可能混在一起,检索结果会包含较多无关内容
  • Chunk 太小时,一条完整规则可能被拆散,模型只能看到结论的一部分
  • Chunk 重叠太多时,相似片段会占用检索名额和模型上下文

切分的目标是让每个 Chunk 尽量包含一段可以独立理解的内容,而非机械地生成完全相同的长度。

正在验证登录状态
请稍候,验证完成后将继续显示文章内容