PageIndex:让 AI 按目录和章节阅读长文档,不再只靠碎片相似度
Launch Date2025-08 (Show HN / GitHub)
Hacker NewsPageIndex
PageIndex:让 AI 按目录和章节阅读长文档,不再只靠碎片相似度
What It Does (它能做什么)
1
无向量检索:把长文档整理成树状目录,再让模型逐层寻找答案。
2
保留上下文:适合法规、财报、合同和手册等结构明确的资料。
3
MIT 开源:可以本地运行和更换模型,适合做专业长文档研究工具。
Why It Matters (为什么值得看)
Problem (解决什么痛点)
普通 RAG 会把文档切成很多小块,问题涉及跨章节条件时容易只捞到一句相似文本,丢掉上下文。合同、年报和技术规范恰恰最依赖章节关系。
Market (谁愿意买单)
审计、投研、法务、专利、标准和政策研究都愿意为更少漏项付费。国内知识库产品很多,但按文档结构推理并展示查找路径的垂直工具仍少。
Edge (为什么选它)
向量数据库检索速度快、生态成熟,PageIndex 更适合结构化长文档,不是所有资料都更好。提醒:它会消耗更多模型推理时间,做产品前要用客户真实文档比较准确率、速度和成本,别只引用项目方基准。
Plain-English Glossary (术语白话解释)
Vectorless RAG (无向量检索)
不依赖相似度数据库,而是按文档结构和推理寻找内容。
Tree Index (树状索引)
把文档按章、节和层级组织成可导航目录。
Chunking (切块)
把长文档切成小段再分别检索的常见做法。
Retrieval Path (检索路径)
系统从目录到具体章节找到证据的过程。
Action Path (怎么变现)
1. 赚取佣金 (Affiliate)
模型 API/文档存储/专业数据库分成用财报或法规演示向量检索漏掉的跨章节答案,导流模型和数据服务。
暂无官方计划
2. 服务变现 (Service)
长文档问答质量升级
替客户比较现有 RAG 与 PageIndex,建立引用、查找路径和人工复核。
3. 模式复刻 (Copycat)
专业文件研究室
做招股书、法规或设备手册版,预设问题模板和章节导航。
Entry Ticket
Cost
$30 - $300/mo (长文档模型调用较多)
Time
4 Days (建立索引、问答和引用展示)
Difficulty
Medium-Hard (逻辑清楚,但成本和速度需要优化)
Source
Open Source Website