知识自进化

2026年7月21日 · 3 分钟阅读时长
Sirchmunk 知识图谱
showcase

Sirchmunk 的知识体系并非静态的——它在持续进化。每一次搜索交互都会产生可复用的知识聚类,这些聚类随时间推移不断合并、拓展,最终形成更高层级的元社区。本页面展示了这一自进化知识架构及其交互式可视化。

知识自进化

Sirchmunk 知识图谱
知识图谱 — 知识聚类交互式可视化与生命周期阶段

Web UI 的知识图谱页面基于 Cytoscape.js 构建,将聚类渲染为节点,相似度边和共查询边渲染为连接,并通过色彩编码区分生命周期状态:

  • Emerging(新兴) — 刚形成的聚类,验证有限
  • Stable(稳定) — 经多次查询持续强化的聚类
  • Meta(元级) — 通过社区发现算法识别的高阶社区
  • Deprecated(弃用) — 底层证据已不再支撑的聚类
  • Contested(争议) — 存在冲突或矛盾证据的聚类

用户可以探索聚类详情、回溯证据至源文档,并观察知识拓扑如何在搜索会话间持续演化。

知识进化器架构

知识进化器架构
KnowledgeEvolver — 知识图谱维护的四阶段进化周期

KnowledgeEvolver 编排了一个四阶段进化周期,由搜索活动触发,在后台异步运行:

阶段一 — 连接与合并

当新聚类在缓冲区中累积到一定数量,进化器计算两两相似度。相似度 ≥ 0.90 的聚类被合并;相似度 ≥ 0.60 的聚类之间建立跨聚类边。这将来自相关查询的碎片化知识整合为连贯的单元。

阶段二 — 边刷新

对已有边进行重新评估。陈旧或弱连接被剪枝,边权重根据近期共查询模式和语义漂移进行更新。这确保图谱拓扑与实际使用模式保持一致,而非停留在历史遗迹上。

阶段三 — 元聚类发现

Leiden 社区发现算法(通过 igraph 实现)识别更高阶的结构——形成连贯知识社区的聚类群组。这些元聚类代表了单个查询无法独立产生的涌现式领域专长。

阶段四 — 全局更新

生命周期状态在整个图谱中同步。持续被强化的聚类从"新兴"晋升为"稳定";孤立或被反驳的聚类向"弃用"状态迁移。版本号和时间戳同步更新以维护审计轨迹。

整个周期在预算约束下运行(LLM 并发信号量、缓冲区阈值),绝不阻塞查询热路径。结果持久化至 DuckDB + Parquet,并通过增量清单实现崩溃恢复。

知识进化实录

这段延时回放展示了在 4 篇文档上经 200 次查询后知识聚类的演化过程。你可以观察到孤立聚类如何涌现、通过共享证据建立连接、合并为整合的知识单元,最终形成元社区——全程无需人工干预。

设计理念

  • 观测驱动,而非规则驱动:进化由实际搜索模式触发,而非预定义规则。系统通过观察哪些聚类被复用来学习哪些知识值得保留。
  • 源头保真:知识进化改变的是导航效率——系统寻找证据所走的路径——但绝不改动源文档本身。每一个事实都可追溯至其原始位置。
  • 有界成本:进化在预算约束下运行(LLM 并发信号量、缓冲区阈值),绝不阻塞查询热路径。

使用方式

知识进化默认开启。可通过环境变量或 SDK 参数 enable_knowledge_evolution 进行配置。

知识图谱可从 Web UI 侧边栏导航的 “Knowledge”(知识) 入口访问。聚类及其关系也可通过 Python SDK 进行编程查询。

ModelScope Team
Authors
AI Research & Engineering
Building open-source AI infrastructure for the community. Sirchmunk is our embedding-free, agentic search engine.