欢迎光临北京软件和信息服务业协会官方网站
奎章⋆智能知识管理平台:面向政企业务的可信知识底座
发布日期:2026-09-14    来源:云粒智慧    分享到:

先看一个问题。

业务人员问系统:"这个事项现在的审批时限是几个工作日?"

普通知识库会返回一段流畅的话。我们的平台返回的是这样一条结果:


🧠 推理过程

Step 1   意图识别:用户查询事项审批时限

Step 2   检索召回:命中 3 篇文件,涵盖新旧两个版本

Step 3   冲突检测:发现〔2022〕7号已被〔2025〕12号废止

Step 4   采信现行版本,定位到包含第三条第二款的知识片段


答复:15个工作日。

依据:片段1 · 92.5%来源文件《XX市行政审批局关于优化XX事项办理流程的通知》(X审批〔2025〕12号),片段内容包含第三条第二款。


差别不在于哪句话说得更漂亮,而在于第二条能被点开、能被核对、能被写进办件记录里。

政务AI进入落地阶段之后,真正卡住项目的不是模型,是知识。

模型负责生成,知识库负责保证生成的东西是对的、是现行的、是查得到出处的。

云粒智慧的智能知识管理平台,做的就是这一层。

它的能力可以归结为五个词——读得懂、找得准、可追溯、管得住、用得起来:读得懂政企复杂材料,找得准现行有效的那一条,每个结论可追溯到原文的条款与页码,知识上线之后管得住不退化,并且能通过Agent和API真正接进业务里用起来。

这五项,每一项背后都是一套与市面常见方案不同的具体做法。下面逐条拆开讲。


— 01 —

读得懂:按材料类型解析,不按字数切

53f4bba7-921f-4816-ad78-14a4602a057a.png

这是整个平台的地基,也是和通用RAG差距最大的一环。

通用方案的做法是:设定一个chunk size,比如512个token,滑动窗口切下去。这对小说、网页、产品手册够用,对政企材料是灾难——一条法规条款被从中间切断,一张Excel表格的表头和数据行分了家,红头公章的OCR噪声混进正文,一个FAQ的问和答落到两个片段里。后面检索再准,召回的也是碎片。

平台的做法是先判断材料类型,再选择解析策略:

材料类型

专项解析能力

公文 / 红头文件

发文字号提取、版面噪声处理、条款边界切片

法规 / 规章制度

条款编号识别、条款提取、章节上下文关联

FAQ 问答库

Q-A强制绑定,作为不可分割单元入库

操作手册

图片与相关文字内容关联存储

业务流程文档

流程图OCR识别、流程节点与条件分支解析

表格 / 数据类文档

表格行列语义绑定、表格摘要、字段描述提取

通知公告

短篇材料按单一语义单元整体入库

扫描件 / 图文材料

OCR识别、图文混排版面分析、结构化内容提取

支持 Word、PDF、Excel、TXT、Markdown、CSV、PPT 及图片批量上传、拖拽上传、URL抓取导入和手工Markdown创建;解析引擎可按文件类型分别指定,未配置的走内置引擎。

在解析的同时,平台还做三件后面会反复用到的事:

元数据结构化抽取:发文机关、发文字号、发文日期、密级、适用部门自动提取,入库即可作为检索过滤条件;

有效期管理:生效周期由人工定义和维护,系统自动标注有效期状态,到期前自动提醒,到期后知识自动失效,为"版本冲突"和"到期预警"提供数据来源;

片段级精确索引:精确定位到具体知识片段及片段内的关键内容,为答案引用、原文查看和证据追溯提供准确依据。

最后这一条看起来最不起眼,却是"可追溯"能力的物理基础。没有在解析阶段绑定位置,后面无论如何都补不出真正的证据链。

切片策略本身也可配置:语义段落、标题层级、固定长度、外部语义切片、父子层级切片,分块大小、重叠、分隔符、Token上限均可调;还可开启AI问题生成,在解析时为每个分块预生成相关问题,提高召回率。


— 02 —

找得准:三路并行召回 + 精排,不是只做向量

a066c5e8-8582-4c04-bd74-05bf8e119c49.png

大部分"知识库"产品的检索,本质是一次向量相似度查询。问题在于:向量擅长理解口语化提问,但对"X政发〔2024〕18号"这种精确串、对实体之间的隐性关联,命中率并不高。

平台采用多路并行召回 + 加权融合 + 精排的结构:


召回层(并行)

全文关键词检索:基于BM25倒排索引,保证法条名称、文号、专有名词精确命中,配MMR去重;

语义向量检索:基于Embedding相似度,处理"办这个事要带啥"这类口语化提问;

图谱关联检索:从实体节点出发沿知识图谱关系边扩展,图查询支持不少于3跳——问"防汛",能顺着实体关系把预案、责任单位、历史处置案例一并带出来。


增强层

元数据过滤检索:按部门、时间、类型、有效期及自定义字段过滤,"只查现行有效的""只查本区的"直接在检索层生效;

查询理解与改写:意图识别、Query改写,支持视觉模型图片分析;

相似条目召回:子Chunk召回父Chunk、总结Chunk召回原始Chunk、问答Chunk召回原始Chunk——命中一个片段,把它所属的完整上下文一并取回。


精排层

Cross-Encoder 重排 + MMR 多样性 + 复合评分,向量召回数量、关键词阈值、向量阈值、重排数量、重排阈值全部可调。

调不调得好,不靠感觉。平台内置检索评测与调优模块:验证集管理、批量语料导入、内置评测语料,支持评测任务创建与执行,输出 Precision、Recall、MRR、MAP、NDCG 等检索指标,以及 BLEU、ROUGE、LLM打分等生成质量评估;支持多版本配置对比,换一个Embedding模型、调一次权重,效果是升是降,有数据说话。

这一点在验收环节尤其关键——"感觉还行"没法验收,指标表可以。


— 03 —

可追溯:返回的不是"参考来源",是坐标

374aac30-6030-432b-8373-a5c2138e30ca.png

很多产品也标"支持溯源",点进去发现只给了一个文件名。文件有80页,业务人员还是得自己翻。

平台的证据片段返回的是完整溯源信息:命中片段原文、来源文件、片段内关键内容定位。上层应用拿到这组信息,可以直接实现片段原文查看和命中内容高亮。

这决定了平台能不能进高责任场景。审批人员要在办件记录里写明依据,执法人员要确认引的是现行条款而不是已废止的旧法,应急会商要确认调出的是最新版预案——这些场景不接受"看起来对",只接受"核实得了"。


— 04 —

管得住:五类冲突检测 + 治理闭环

53e13474-bef6-4724-8ea9-4b0466e477c6.png

知识库项目最典型的失败方式不是上不了线,是上线半年后没人用了:政策更新只同步了一部分,旧问答还在被命中,业务部门慢慢就不问了。

平台把治理做成了系统能力,而不是靠管理员自觉。

知识冲突发现与裁决,覆盖五类:

1. 版本冲突——识别版本切换和过渡覆盖窗口期的新旧知识碰撞,支持版本有效期校验和生效时间管控;

2. 内容矛盾冲突——同一业务主题下语义互斥、结论直接对立的真实冲突;

3. 事实纠正冲突——新增知识对存量错误或过时事实的更正,辅助区分正常纠错与异常数据错误;

4. 上下文相关冲突——内容都真实但适用场景、前置条件不同的"伪冲突",标记生效边界,避免误删;

5. 知识演进——草稿、待审核、已上线、试点版本之间的结论迭代,辅助优先采纳更成熟、更新近的知识结论。

每条冲突记录严重度和置信度,提供冲突列表、冲突汇总、冲突详情,由授权人员在冲突队列中查看证据、执行处理并留痕。系统负责发现和举证,人负责拍板——这个分工是政务场景能接受的唯一分工。

新知识入库时还有入库冲突辅助检查,基于Wiki模块对待入库内容做前置比对,在入库那一刻就提示潜在冲突。

Wiki 协作层则解决知识的沉淀和体检:支持从文档自动抽取Wiki内容(MAP-REDUCE三阶段流程),生成结构化索引目录并关联原始文档、生效时间和状态;提供页面间双向链接图、断链/孤立页面/过时引用的Lint检查、知识问题标记与跟踪。

全生命周期受控:知识审核流程可总开关控制,支持创建后上线审批、主动下线审批、驳回后修改重提;配置了生效结束时间的知识临近过期自动提醒,支持延期申请和批量延期,审批通过后按新有效期继续生效。审核中心提供待审核、我发起的、全部记录三个视图,支持修改前后对比、审批历史查看、批量通过或驳回。

两级权限:知识库级基于完整RBAC体系(用户、角色、权限、工作空间隔离),可创建知识库专属角色并关联人员;类目级按2-5级类目树细化授权,遵循"默认继承、按需收紧"模型。关键是——这套权限过滤覆盖全部下游场景:搜索、智能体、RAG对话、知识图谱、冲突检测,一处收紧,处处生效,不存在"权限只管前台、后台照样能查出来"的漏洞。


— 05 —

用得起来:Agent、Skill 与开放接口

602d56db-25c3-4489-a6f3-d7a82e8acee3.png

知识底座本身不产生业务价值,得接到具体任务上。

Agent智能体按场景配置:运行模式(快速问答/智能推理)、大语言模型与生成参数、可访问的知识库范围、检索策略参数、工具集与最大迭代数、可调用的MCP服务、预装Skills范围、网络搜索、图片上传与视觉模型、多轮对话上下文轮数与问题改写(消解指代、补全省略)。

底层是HarnessAgent 架构,支持长会话、内存压缩和上下文溢出保护——这决定了一次复杂的材料起草任务能不能撑到最后。内置工具集包括思考、制定计划、关键词搜索、语义搜索、文档分块查看、Wiki读写、问题管理、数据分析;内置 Agent Skills 覆盖产业场景适配、引用生成、文档协作、文档分析、行业报告生成。

对外开放:标准REST API + Swagger OpenAPI文档;SSE流式响应,返回 thought、tool_call、tool_result、answer 等事件,前端可完整还原推理过程;JWT Token、角色权限、API Key、鉴权拦截链,支持AKSK凭据管理(权限范围、有效期、一键吊销)。

部署与安全:支持私有化部署,数据不出内网,模型可本地部署;租户管理员可新建空间并指定空间管理员,空间之间资源逻辑隔离;登录失败次数限制、超时退出、并发登录控制、密码有效期等安全策略可配;提供Neo4j Kubernetes StatefulSet部署配置和Redis集群接入支持。


✦ 和你可能已有的东西,差在哪

6369eb4e-8a60-47b9-9373-9abf5d8e3c66.png

客户往往已经建了一些东西。这张表说明这个平台补的是哪一块:

你已有的

它解决了

仍然缺什么

本平台补什么

OA / 文档中心

文件归档、流程、权限

文件能存,但知识不能直接服务AI;文号、条款、页码、有效期无法被准确引用

公文法规专项解析,文号、条款、页码、有效期、来源元数据全部绑定

通用RAG / 云厂商知识库

上传、切分、向量检索、问答

常见问题能答,但红头文件、表格图文、法规条款和证据链处理不够细

三路并行召回+精排,答案带出处和证据片段,检索指标可评测

智能体 / 工作流平台

编排模型、工具、API

流程能搭,但依赖底层知识质量,无法保证依据正确、无法处理材料冲突

五类冲突检测、Wiki沉淀、问题检查、人工处理、持续优化

业务系统 / 专题库

结构化数据、台账、流程

数据在系统里,政策、制度、案例、历史材料分散,跨部门复用难

场景化知识底座,一次建成、跨部门跨场景复用

同类产品多在解决"能不能接入模型和检索",这个平台解决的是"知识能不能被追溯、被治理、被检查、被复用"。


✦ 这些能力用在哪

905dc2f0-257c-4cd2-a606-d5cd42db257a.png

1政策咨询与办事导办:12345热线、办事材料、流程导办——找准依据、指导办理,口径统一;

2汇报材料检索与起草:汇集材料、修改大纲、形成初稿、来源核验;

3法规依据与合规审查:热线工单处置依据、合同审核、制度审查——法规、案例、风险提示一并调出;

4应急预案研判与处置:水利防汛等场景,按当前条件调出相关预案条款、处置清单与历史案例;

5产业项目研判与服务:招商企业画像、园区政策匹配、供需对接、走访准备。

五类任务,共享同一套知识底座。扩场景的方式是加材料、加Skill、配Agent,不是重新搭一套库。

每类任务里,平台负责把依据找出来、把片段和页码摆出来、把风险和初稿备好,最终的答复、审批和签发仍由责任人确认——这也正是它敢被审批、执法、应急这类场景采用的前提。


✦ 结语

政务AI的下半场,

拼的不是谁的模型更会说话,

而是谁的答案经得起查。

当坐席的每一句答复都有出处,当会商桌上的每一份预案都是现行版本,当材料里的每一个数据都能回到原始条款和页码——AI才真正从"能演示"走到"敢使用"。

奎章 ✦ 智能知识管理平台,做的就是这件事。

你知道你的Internet Explorer是过时了吗?

为了得到我们网站最好的体验效果,我们建议您升级到最新版本的Internet Explorer或选择另一个web浏览器.一个列表最流行的web浏览器在下面可以找到.