资讯详情

资讯详情

OpenKB的下一步:Web UI、数据库存储引擎与PageIndex开源生态全景

OpenKB的下一步Web UI、数据库存储引擎与PageIndex开源生态全景【免费下载链接】OpenKBOpenKB: Open LLM Knowledge Base项目地址: https://gitcode.com/gh_mirrors/ope/OpenKBOpenKB 是一个开源的 LLM 知识库工具它把 PDF、Word、网页等原始文档编译成结构化、互相链接的 Wiki 知识库并借助 PageIndex 的无向量推理检索实现长文档问答。目前它还是纯命令行CLI形态但路线图已明确了两块关键拼图Web UI浏览和管理 Wiki 的图形界面与数据库存储引擎摆脱纯文件存储支撑大规模知识库。本文将带你了解 OpenKB 的现状架构、这两项升级要解决的问题以及 PageIndex 开源生态的全景图。一图看懂OpenKB文档如何变成知识库 OpenKB 的核心思路源自 Andrej Karpathy 的LLM 编译知识库概念知识只编译一次之后持续沉淀而不是每次查询都从零重新检索。整体流程分四步见上方架构图阶段做了什么产出1️⃣ 原始文件入库把.txt、.md、.pdf等丢进raw/目录或用openkb add添加文件/目录/URL文档登记入.openkb/hashes.json2️⃣ LLM 处理短文档走 markitdown 转 Markdown 后全文读取长 PDF≥20 页走 PageIndex 树索引文档摘要与结构3️⃣ 编译 WikiLLM 生成摘要页、概念页、实体页并互相链接wiki/目录纯 Markdown4️⃣ 能力交付查询问答、多轮对话、技能工厂、知识图谱可视化可用的知识与产出传统 RAG 每次提问都重新发现知识什么都积累不下来OpenKB 则把知识编译成持久 Wiki交叉引用已存在、矛盾会被标记、综合内容随文档增多而丰富。这是它与传统检索增强方案的根本差异。Web UI为什么知识库需要图形界面 ️目前 OpenKB 的所有操作都发生在终端里openkb add、openkb query、openkb chat。对开发者很顺手但对普通用户来说有三个痛点看不懂产出Wiki 是一堆带[[wikilinks]]的 Markdown 文件需要配合 Obsidian 才能看到图谱效果难管理查看状态、删除文档、检查 lint 报告都得敲命令难分享知识图谱目前生成在 examples/visualize/graph.html 这类单文件 HTML 中每次都要重新运行 openkb/visualize.py。路线图中列出的Web UI for browsing and managing wikis正是要解决这些问题一个浏览器端界面直接浏览 Wiki 页面、查看知识图谱、管理文档入库与删除。对新手来说这意味着零命令行使用 OpenKB 成为可能——配置在 config.yaml.example 中的模型、语言、PageIndex 阈值等参数未来大概率也能在界面上直接调整。顺带一提OpenKB 的 Wiki 与 Obsidian 完全兼容现阶段如果你只是想看见知识连接可以先用openkb visualize生成 3D/思维导图/径向三种视图的交互图谱详见 examples/visualize/README.md。数据库存储引擎从纯文件到可规模化 现在Markdown 文件 JSON 注册表OpenKB 目前刻意不用向量数据库。知识本体就是wiki/下的纯.md文件符合 Google OKF 规范而文档登记信息存于.openkb/hashes.json由 openkb/state.py 中的HashRegistry类维护——它基于文件 SHA-256 哈希做幂等去重保证重复添加同一文档会被跳过。这种设计的好处是透明、可版本化、任何编辑器都能打开局限也很明显注册表是单文件 JSON所有元数据加载进内存、线性扫描查找文档量上万后openkb list、status会变慢没有索引结构按路径、按概念检索只能遍历难以扩展到嵌套文件夹、大规模文档集合这两项同样在路线图中。下一步Database-backed storage engine路线图中的Database-backed storage engine数据库支撑的存储引擎意味着把元数据与索引从纯 JSON 迁移到真正的数据库如 SQLite 一类嵌入式方案预期收益✅ 毫秒级的文档查询、状态统计与去重检查✅ 为嵌套文件夹 大型文档集合的规模化铺路✅ 与层级化概念主题索引协同支撑超大知识库✅ Wiki 本体仍是 Markdown 文件——数据库存的是骨架知识内容依然可读、可分享。PageIndex开源生态全景不止一个OpenKB OpenKB 是 PageIndex 生态中的知识库应用层。整个生态围绕无向量、基于推理的树状检索这一核心理念展开项目定位与OpenKB的关系PageIndex长文档的树状索引与推理检索框架OpenKB 的检索引擎核心依赖长文档路径全靠它ChatIndex面向长对话历史与记忆的树索引检索同一理念在对话场景的延伸ConDBKV-Cache 原生的上下文数据库面向大规模树状检索为规模化检索提供底层存储PageIndex MCPPageIndex 的 MCP 服务器让任意 MCP 客户端调用 PageIndexOpenKB 中 PageIndex 的两种运行模式值得了解详见 examples/pageindex-cloud/README.md本地模式默认无需任何 API Key纯本地完成长 PDF 的树索引云端模式设置PAGEINDEX_API_KEY后可获得 OCR扫描件识别、更快的结构生成、700 页大部头的分窗索引甚至可以用openkb add --from-pageindex-cloud DOC_ID直接导入云端已索引的文档本地连 PDF 都不用存。依赖与架构细节可在 pyproject.toml 与 README.md 的 The Stack 一节看到markitdown 负责多格式转 MarkdownLiteLLM 负责多模型网关OpenAI、Claude、Gemini 等OpenAI Agents SDK 负责 Agent 编排。写在最后一个正在长大的开源知识库 对新手而言现在上手 OpenKB 的体验已经完整pip install openkb mkdir my-kb cd my-kb openkb init openkb add 你的文档.pdf openkb query 这篇文档的核心结论是什么而 Web UI 和数据库存储引擎这两个路线图项分别解决用起来更简单与撑得起更大规模两件事。加上 OKF 规范、Obsidian 兼容、Skill Factory把 Wiki 蒸馏成可分发的 Agent 技能见 examples/skills/transformer-attention/SKILL.md以及背后 PageIndex、ChatIndex、ConDB 组成的开源生态OpenKB 正在从个人命令行工具走向可共享、可规模化的知识基础设施。关注它的路线图见 README.md 的 Roadmap 一节非 PDF 长文档处理、嵌套文件夹、层级化概念索引、数据库存储引擎、Web UI——每一项落地都会让这个开源知识库更值得投入。 更多真实产出示例一份论文编译出的 Wiki、技能、幻灯片、知识图谱都在 examples/ 中全部由 OpenKB 自动生成值得逐个打开看看。【免费下载链接】OpenKBOpenKB: Open LLM Knowledge Base项目地址: https://gitcode.com/gh_mirrors/ope/OpenKB创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →