<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Retrieval | Sirchmunk</title><link>https://modelscope.github.io/sirchmunk-web/zh/tags/retrieval/</link><atom:link href="https://modelscope.github.io/sirchmunk-web/zh/tags/retrieval/index.xml" rel="self" type="application/rss+xml"/><description>Retrieval</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>zh</language><lastBuildDate>Sun, 20 Sep 2026 00:00:00 +0000</lastBuildDate><image><url>https://modelscope.github.io/sirchmunk-web/media/logo_hu_60b56fdaf40cfb0f.png</url><title>Retrieval</title><link>https://modelscope.github.io/sirchmunk-web/zh/tags/retrieval/</link></image><item><title>Sirchmunk v0.2.0：LENS 论文发布、多路 DEEP 检索与大语料鲁棒性</title><link>https://modelscope.github.io/sirchmunk-web/zh/blog/v0.2.0/</link><pubDate>Sun, 20 Sep 2026 00:00:00 +0000</pubDate><guid>https://modelscope.github.io/sirchmunk-web/zh/blog/v0.2.0/</guid><description>&lt;p&gt;Sirchmunk v0.2.0 是项目的一个转折点。Sirchmunk 检索引擎背后的核心算法已在研究论文中形式化并发布至 arXiv，DEEP 搜索管线围绕多路融合进行了重构，系统现在强制执行严格的检索成本不变量，确保在任意规模的语料上都能保持可预测的性能。&lt;/p&gt;
&lt;h2 id="lens研究论文"&gt;LENS：研究论文&lt;/h2&gt;
&lt;p&gt;Sirchmunk 上下文搜索的理论基础已在 &lt;strong&gt;&amp;ldquo;LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents&amp;rdquo;&lt;/strong&gt;（
）中形式化。&lt;/p&gt;
&lt;p&gt;LENS 将检索重新表述为&lt;em&gt;预算约束证据定位&lt;/em&gt;：给定查询和原始文档语料，系统在隐式证据空间上维护一个查询条件信念，通过提议策略和 LLM 相关性预言机迭代精炼 — 全程受显式 token 预算约束。&lt;/p&gt;
&lt;p&gt;受控评估的关键结果：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;500 题评估&lt;/strong&gt;：62.4% 精确匹配（EM），84.8% 证据召回率（对比 ReAct 基线 65.2% EM，但证据召回仅 50.4%）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;150 题 fullwiki 子集&lt;/strong&gt;（原始 Wikipedia 转储，零索引）：LENS 达到 43.3% EM，对比 ReAct 的 42.7% EM，且证据接地能力显著更强（84.0% vs. 70.7%）。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这些数据表明 LENS 以微小的准确率代价换取了显著更好的证据可追溯性 — 答案不仅正确，而且&lt;em&gt;可证地接地&lt;/em&gt;于源材料。&lt;/p&gt;
&lt;h2 id="多路-deep-检索"&gt;多路 DEEP 检索&lt;/h2&gt;
&lt;p&gt;DEEP 模式经过了根本性重构。取代单一检索策略，现在并行运行 &lt;strong&gt;五条互补的检索路径&lt;/strong&gt;：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;词法路径&lt;/strong&gt; — 基于关键词的内容匹配，采用 IDF 加权评分。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;实体路径&lt;/strong&gt; — 对命名实体、标识符和结构化值的精确匹配探测。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;目录路径&lt;/strong&gt; — 利用命名约定、路径层次和修改时间戳进行文件系统结构分析。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;结构路径&lt;/strong&gt; — 启发式文档树导航（v2），带有针对 DOCX、RST 等格式源的结构锚点。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;主题图路径&lt;/strong&gt; — 跨文档主题图路由，利用自进化知识图谱识别相关文档集群。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;五条路径的结果通过**置信度加权倒数排名融合（RRF）**进行融合。&lt;strong&gt;soft 路由收缩&lt;/strong&gt;机制在单条路径产生高置信度匹配时动态禁用低产出路径，在不损失答案质量的前提下降低延迟和 token 消耗。&lt;/p&gt;
&lt;p&gt;
&lt;figure id="figure-sirchmunk-v020-系统架构多路-deep-检索与-lens-框架集成"&gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Sirchmunk 架构"
srcset="https://modelscope.github.io/sirchmunk-web/blog/v0.2.0/Sirchmunk_Architecture_hu_20a06e55d6b5f4b.webp 320w, https://modelscope.github.io/sirchmunk-web/blog/v0.2.0/Sirchmunk_Architecture_hu_85555c5afe12fe9a.webp 480w, https://modelscope.github.io/sirchmunk-web/blog/v0.2.0/Sirchmunk_Architecture_hu_a4dc28c9d30189b.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://modelscope.github.io/sirchmunk-web/blog/v0.2.0/Sirchmunk_Architecture_hu_20a06e55d6b5f4b.webp"
width="760"
height="328"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;figcaption&gt;
Sirchmunk v0.2.0 系统架构：多路 DEEP 检索与 LENS 框架集成。
&lt;/figcaption&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h2 id="大语料鲁棒性"&gt;大语料鲁棒性&lt;/h2&gt;
&lt;p&gt;早期版本在超大、含归档文件的语料上可能卡顿或超时。v0.2.0 引入了&lt;strong&gt;检索成本不变量&lt;/strong&gt; — 确保单文件和单次查询成本永远不会无界增长的硬约束：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;&lt;code&gt;GREP_RGA_ADAPTERS&lt;/code&gt;&lt;/strong&gt;：基于能力的适配器白名单。查询热路径上仅启用有界文档提取器（poppler、pandoc）；无界递归适配器（decompress、zip、tar、sqlite、ffmpeg）限制为离线提取。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;&lt;code&gt;GREP_MAX_FILESIZE_MB&lt;/code&gt;&lt;/strong&gt;：单文件大小上限。超过阈值的文件在实时查询中被跳过。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;&lt;code&gt;GREP_TIERED_SCAN&lt;/code&gt;&lt;/strong&gt;：对所有文件执行快速原生 &lt;code&gt;rg&lt;/code&gt; 扫描，与限定富格式扩展名的 &lt;code&gt;rga&lt;/code&gt; 扫描取并集，避免适配器调度遍历整棵文件树。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;快速失败超时预算&lt;/strong&gt;：&lt;code&gt;GREP_TEXT_TIMEOUT&lt;/code&gt; 用于文本扫描，&lt;code&gt;GREP_TIMEOUT&lt;/code&gt; 用于富文档扫描；超时后搜索优雅降级为原生 &lt;code&gt;rg&lt;/code&gt;，而非挂起。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;目录扫描现已默认开启以增强文件名路由，硬 token 预算将每次查询限制在可配置额度内。&lt;/p&gt;
&lt;h2 id="泛化优先设计"&gt;泛化优先设计&lt;/h2&gt;
&lt;p&gt;v0.2.0 对基准特定硬规则采取了原则性立场。硬编码的实体模式、固定列位置、仅限英语的停用词等基准绑定逻辑已被可泛化的替代方案取代：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;接地数值校验&lt;/strong&gt;：计算类答案基于模型披露且证据接地的操作数进行确定性复算 — 完全语料无关。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;可注入分词器&lt;/strong&gt;：分词器和词法策略通过依赖注入提供通用默认实现，而非嵌入模块内部。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;语料自适应统计&lt;/strong&gt;：基于文档频率的自适应停用词剪枝替代固定词表，原生适配所有语言和领域。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;每个替换行为都通过环境开关控制，默认启用新实现，并允许单项故障回滚。&lt;/p&gt;
&lt;h2 id="知识图谱可视化"&gt;知识图谱可视化&lt;/h2&gt;
&lt;p&gt;Web UI 新增基于 Cytoscape.js 的&lt;strong&gt;交互式知识图谱&lt;/strong&gt;。图谱可视化自进化知识聚类及其语义关系，包括生命周期状态（Emerging、Stable、Meta）和边权重。用户可以探索、过滤和深入聚类拓扑，直观了解系统知识随使用的演化过程。&lt;/p&gt;
&lt;p&gt;可视化背后，&lt;code&gt;KnowledgeEvolver&lt;/code&gt; 编排了四阶段后台进化周期——连接与合并、边刷新、元聚类发现（基于 Leiden 社区发现算法）和全局更新——持续维护和整合知识图谱，且不阻塞查询。&lt;/p&gt;
&lt;p&gt;
&lt;figure id="figure-knowledgeevolver--知识图谱维护的四阶段进化周期"&gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="知识进化器架构"
srcset="https://modelscope.github.io/sirchmunk-web/blog/v0.2.0/Knowledge_Evolver_Architecture_hu_4f04be0dfa1ca9b3.webp 320w, https://modelscope.github.io/sirchmunk-web/blog/v0.2.0/Knowledge_Evolver_Architecture_hu_43806d4cd9a45d36.webp 480w, https://modelscope.github.io/sirchmunk-web/blog/v0.2.0/Knowledge_Evolver_Architecture_hu_72c87b060cde1c77.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://modelscope.github.io/sirchmunk-web/blog/v0.2.0/Knowledge_Evolver_Architecture_hu_4f04be0dfa1ca9b3.webp"
width="760"
height="428"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;figcaption&gt;
KnowledgeEvolver — 知识图谱维护的四阶段进化周期
&lt;/figcaption&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p&gt;设计理念是观测驱动的：进化由实际搜索模式触发，而非预定义规则；源头保真始终被保护——系统改变的是寻找证据的导航路径，而非证据本身。完整动画演示请参见
。&lt;/p&gt;
&lt;h2 id="其他改进"&gt;其他改进&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;更广格式覆盖&lt;/strong&gt;：LOG、PPTX、XLSX 文件原生精确匹配回退，启发式文档树 v2（含 DOCX/RST）并以结构锚点引导证据抽取。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;DeepSeek V4 兼容&lt;/strong&gt;：OpenAI 兼容客户端完整支持 DeepSeek V4 思考模式（&lt;code&gt;thinking_content&lt;/code&gt;）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;大语料检索稳定性&lt;/strong&gt;：分层扫描、单文件匹配上限和适配器白名单的综合改进，消除了早期版本在大语料上的超时和卡顿问题。&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="开始使用"&gt;开始使用&lt;/h2&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install --upgrade sirchmunk
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;p&gt;或安装全部附加组件：&lt;/p&gt;
&lt;div class="highlight"&gt;&lt;pre tabindex="0" class="chroma"&gt;&lt;code class="language-bash" data-lang="bash"&gt;&lt;span class="line"&gt;&lt;span class="cl"&gt;pip install &lt;span class="s2"&gt;&amp;#34;sirchmunk[all]&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;文档&lt;/strong&gt;：
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;GitHub&lt;/strong&gt;：
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;论文&lt;/strong&gt;：
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;p&gt;&lt;em&gt;
·
&lt;/em&gt;&lt;/p&gt;</description></item></channel></rss>