更新时间:2026-07-06 gmt 08:00

优化知识库配置-j9九游会登录

在文档质量得到保障的前提下,agentarts知识库的配置参数将直接决定文档的解析质量、切片精准度与最终检索效果。本节将介绍创建知识库时的核心配置、分段策略的选择与配置,以及在单智能体和工作流中的检索参数配置。

创建知识库时的核心配置

向量模型

向量模型负责将文档切片和用户查询分别转化为数值向量,是语义检索的基础。向量模型创建后不支持修改,选型时需综合考虑语义理解精度、支持的文本长度和推理性能。agentarts提供的默认知识库预置的向量模型为pangu_embedding。企业版用户可以通过接入第三方知识库的方式使用其他向量模型。

精排模型

精排模型对向量模型初步召回的候选切片进行二次评分排序,将相关度最高的切片置于最前,显著提升检索精准度。agentart提供的默认知识库预置的精排模型为pangu_rerank。企业版用户可以通过接入第三方知识库的方式使用其他精排模型。

文档解析配置

文档解析配置决定了知识库在入库时如何处理文档中的图片、表格、页眉页脚和目录页等元素。各配置项的详细说明如下:

表1 文档解析配置

配置项

说明

ocr增强

  • 不开启,不可调用ocr服务进行智能文档识别。
  • 开启后,即可调用ocr服务进行智能文档识别,如表格解析或扫描文件等。

页眉页脚解析

  • 未开启,解析结果中不包含页眉页脚。
  • 开启后,解析结果中包含页眉页脚。

目录页解析

  • 未开启,解析结果中不包含目录页。
  • 开启后,解析结果中包含目录页。

图片解析

  • 未开启,则在文档中遇到图片默认跳过,不处理图片。
  • 开启后,根据需要选择“提取图片文本”或者“仅保留原图”。
    • 提取图片文本:识别图片内文字。
    • 仅保留原图:仅提取图片保存,不会识别图片内容,便于问答图文展示。

分段策略的选择与配置

分段策略决定了文档如何被切分为知识切片,是影响检索精准度最关键的配置之一。合理的分段能平衡上下文完整性与检索精准度——切片过大可能引入噪声,切片过小可能丢失上下文关联。agentarts提供三种分段策略,应根据文档类型与业务需求选择。

自动分段

系统按照预设规则自动切分,无需额外配置。选择该策略时,系统会自动以句号、分号、问号、感叹号等标点符号作为分段依据,将文档分割为独立的句子或段落。自动分段支持以下能力:

  • 可识别段落边界,支持跨页段落合并。
  • 可识别并排除页眉、页脚、脚注等非重点内容。
  • 支持解析文档中带线框的表格内容。
  • 支持解析表格中的图片信息。
  • 优点:系统预设,无需额外配置,开箱即用,使用效率高。
  • 缺点:分段效果依赖文档本身的质量,结构混乱的文档效果有限。
  • 适用场景:适用于大部分分段场景,是使用情况最多的分段类型,尤其适合格式较为规范的通用文档。

长度分段

根据字符数进行切分,支持灵活配置分段参数,严格控制每个切片的长度上限。需要完成以下配置:

  • 分段标识符:遇到所选符号即触发截断,符号之间没有优先级,最终分割后合并到预计最大长度。支持中文句号、英文句号、中文/英文感叹号、中文/英文问号、空格、中文/英文逗号。

    注意:如果文档中未命中设定的分段标识符,分段将会失败,请确认文档内容与所选标识符匹配。

  • 分段预计长度:分段的最大字符长度,取值范围为1~6000,默认值为500。当段落长度超过设定值时,系统截取最大长度片段为新切片,随后回溯重叠字符后继续向后处理,直到文档结束。

    示例:设置分段长度为500,当某段落长度为800时,将切分为两段。

  • 优点:严格控制分段长度,可精确管理每个切片的token消耗,适合对上下文窗口成本敏感的场景。
  • 缺点:配置较复杂,需要用户对文档内容和参数规则有较深理解,且不适用于所有文档类型。
  • 适用场景:适用于对分段长度有严格要求的场景,如需要精确控制每次检索的token消耗。

层级分段

根据文档的目录结构和章节划分等层级信息,将内容切分为不同层级的文本单元,每个切片对应文档中的一个完整知识单元。需要完成以下配置:

  • 层级解析模型:
    • 自动解析:系统自动识别文档的层级结构,适合标题格式较为规范的文档。
    • 规则解析:支持添加自定义层级规则,适合需要精确控制层级识别逻辑的场景。
  • 标题层级深度:设置切分所依据的标题级别,取值范围为1~10。例如,文档包含最多 5 级标题,如果将标题层级深度设置为3,则系统会将所有3级标题下的内容合并为一个文本块,作为整体执行后续切分。
  • 标题保存方式:决定标题信息在切片中的保存形式,影响检索结果的展示和索引构建方式:
    • 保存多标题组合:将多级标题组合保存,格式为“1级标题 - 2级标题 - 3级标题 - … - 文本内容”。
    • 保存最后一级标题:仅保存最末一级标题,格式为“最后一级标题 - 文本内容”。
  • 跨标题合并:
    • 开启:当不同标题下的段落文字较少时,平台自动将其合并到指定的分段长度,有助于生成内容更完整的切片。
    • 关闭:不自动合并不同标题下的内容,各标题下的内容独立切分。
  • 分段标识符和分段预计长度:配置逻辑与长度分段相同,详见上文长度分段说明。
  • 优点:按知识单元边界切分,结构清晰,切片语义完整,检索效率高。
  • 缺点:需要文档具有明确的层级结构,对于结构不规范的文档难以适用。
  • 适用场景:适用于结构层次分明的知识体系,如技术手册、法律条文、标准规范、产品说明书等具有明确章节划分的文档。

三种分段策略快速选型对比

表2 分段策略对比说明

对比维度

自动分段

长度分段

层级分段

配置复杂度

低(无需额外配置)

中(需配置标识符和长度)

中(需配置层级深度等多个参数)

文档结构要求

高(需要规范的标题层级)

切片语义完整性

较好

依赖长度设置

最好(按知识层级切分)

token消耗控制

一般

精准可控

较好

适用场景

大多数通用场景

对切片长度有严格要求的场景

结构化文档(手册、规范、法律条文等)

配置完成后,您可以在知识库详情页的“切片管理”中查看分段效果,或通过“检索测试”验证检索精准度。

相关文档

网站地图