资讯详情

资讯详情

gbrain Ingest Skill 完全指南:把会议、文章、媒体与对话结构化沉淀进个人大脑

gbrain Ingest Skill 完全指南把会议、文章、媒体与对话结构化沉淀进个人大脑【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址: https://gitcode.com/gh_mirrors/gb/gbrainIngest 是 gbrain 技能体系中面向输入侧的路由型技能它不自己处理具体内容而是先解析输入类型再把任务分发到 idea-ingest、media-ingest、meeting-ingestion 等专门技能。本篇指南以 skills/ingest/SKILL.md 为骨架完整讲解它的契约、六阶段摄取管线、实体检测协议、分类媒体工作流与原始来源保留机制并结合仓库源码与配套规则文档让你能直接上手把任何形式的内容URL、视频、PDF、截图、会议转录、推文变成带引用、带反向链接、可追溯的知识图谱节点。1. 技能定位一个分发器而非处理器Ingest 技能的前置元数据frontmatter明确标注了它的本质name: ingest description: Route content to specialized ingestion skills. Detects input type and delegates. triggers: - ingest this - save this to brain - process this meeting tools: - search - get_page - put_page - add_link - add_timeline_entry - sync_brain mutating: true writes_pages: true注意三个关键信息triggers用户说 ingest this、save this to brain、process this meeting 时触发mutating: true / writes_pages: true这是一个会写入大脑页面的技能不是只读查询writes_to它允许写入people/、companies/、concepts/、meetings/、sources/五个目录恰好对应大脑的实体类型与原始数据目录。技能正文第一行就点明了路由职责This skill is a router.并指引到三个专门化入口idea-ingest、media-ingest、meeting-ingestion。也就是说Ingest 的价值在于统一的入口协议与质量底线——无论内容从哪条通道进来都遵守同一套归档、引用、反向链接与溯源规则。2. 契约Contract五条摄取铁律Ingest 技能承诺的行为契约是后续所有阶段的总纲每条写入大脑页面的事实都带内联引用[Source: ...]包含日期与来源provenance每个实体提及都产生反向链接——从该实体的页面指向提及它的页面Iron Law铁律原始来源通过gbrain files upload-raw保留并按大小自动路由存储位置State 区块是重写而非追加——始终写入当前最佳理解每条入站消息都做实体检测——有代表性的实体获得页面或更新。其中第 2 条Iron Law被反复强调Every mention of a person or company with a brain page MUST create a back-link FROM that entitys page TO the page mentioning them. An unlinked mention is a broken brain.未链接的提及就是破碎的大脑。这条规则的具体格式定义在 skills/_brain-filing-rules.md反向链接追加到实体页的 Timeline 或 See Also 区块格式为- **YYYY-MM-DD** | Referenced in page title -- brief context。配套约定文档 skills/conventions/quality.md 对反向链接的定位说得很直白An unlinked mention is a broken brain. The graph is the intelligence.——图结构本身就是智能所在。3. 引用要求MANDATORY六种来源格式与优先级所有写入大脑页面的事实必须携带内联[Source: ...]引用。原文档给出了六种标准格式来源类型引用格式用户陈述[Source: User, {context}, YYYY-MM-DD]会议数据[Source: Meeting {title}, YYYY-MM-DD]邮件/消息[Source: email from {name} re: {subject}, YYYY-MM-DD]网页内容[Source: {publication}, {URL}, YYYY-MM-DD]社交媒体Source: X/handle, YYYY-MM-DD必须带链接综合合成[Source: compiled from {sources}]skills/conventions/quality.md 进一步定义了来源优先级从高到低用户的直接陈述 编译真相已有大脑综合 时间线条目原始证据 外部来源API 富化、网络搜索。当来源冲突时规则是同时标注矛盾双方及各自引用而不是默默二选一——这与 skills/_brain-filing-rules.md 中当来源冲突时用两个引用标注矛盾不要静默选择其一完全一致。4. 六阶段摄取管线从原始输入到图谱节点Ingest 的核心处理流程是六个有序阶段解析来源从输入中抽取人物、公司、日期与事件逐个实体处理用 gbrain 读取实体页——已存在则重写 State 区块更新 compiled_truth绝不追加不存在则先过 notability gate重要性门槛再按正确类型与 slug 存页追加时间线为每个事件在 gbrain 中添加带日期、摘要与来源引用的时间线条目创建交叉引用链接为每个同现的实体对创建适当关系类型的链接反向链接所有实体更新每个被提及实体的页面加入指向本页的反向链接Iron Law时间线合并同一事件出现在所有被提及实体的时间线上——Alice 在 Acme Corp 见了 Bob该事件要同时出现在 Alice 页、Bob 页和 Acme Corp 页。第 4 步的关系类型由质量规则限定knows、works_at、invested_in、founded、met_at、discussed六种。第 6 步的时间线合并是时间线合并的核心在 skills/meeting-ingestion/SKILL.md 中有更严格的要求多公司会议如小组办公时间必须按公司拆分反馈每个公司的时间线条目携带自己的内容而不是整个会议的混合体。5. 每条消息的实体检测让大脑随时间复利的信号循环这是 Ingest 最独特的设计生产级 Agent 应对每一条入站消息做实体检测这是让大脑随时间复利的信号检测回路。协议分四步扫描消息中的实体提及人物、公司、概念、原创思考。除纯操作性消息外每条消息都触发对每个检测到的实体gbrain search name判断页面是否存在——存在则用gbrain get slug加载上下文用编译真相辅助回复若消息含新信息则更新页面不存在则评估重要性见 skills/_brain-filing-rules.md值得跟踪就用gbrain put type/slug创建页面创建或更新页面后同步gbrain sync --no-pull --no-embed不要阻塞对话实体检测与富化应在回复的同时进行而不是之前——用户不应为了等待大脑写入而延迟获得答案。什么算值得跟踪notability用户会与之互动或讨论的人物不是随机提及与用户工作或兴趣相关的公司用户引用或创造的概念/框架用户自己的原创思考想法、论点、观察——价值最高。完整的 notability gate 见 skills/_brain-filing-rules.md其核心原则是When in doubt, DONT create. A missing page can be created later. A junk page wastes attention and degrades search quality.拿不准就别建——缺失的页面以后可以补垃圾页面浪费注意力并降低搜索质量。用户原创思考该捕获什么原创思考是最高价值的信号捕获原话——用户的语言本身就是洞察不要转述新颖的观察或论点框架、心智模型、启发式方法别人看不到的想法之间的连接带推理的反共识立场对外部刺激的强烈反应什么触发了它为什么。这条精确措辞保留Exact Phrasing Preservation原则在 skills/_output-rules.md 中被系统化为全局规则直接引用必须逐字保留在引用块中想法和框架的 slug 与标题要用用户自己的术语观察要捕获措辞而非消毒版。补充技能 skills/signal-detector/SKILL.md 把这一环做成了可选的环境捕获模式默认关闭需要用户显式 opt-in并把想法是智力资本实体是记账作为核心哲学。6. 分类媒体工作流按主要主题归档而非按格式原文档反复强调归档铁律File by PRIMARY SUBJECT, not by format按主要内容归档不按格式。完整决策协议在 skills/_brain-filing-rules.md识别主要内容人物公司概念政策议题归档到与主题匹配的目录从相关目录交叉链接拿不准时问自己以后搜索时会用什么词来找这个页面该文档给出了一张常见误归档模式对照表严禁犯的错误包括错误做法正确做法原因主题分析 -sources/- 相应主题目录sources/ 只放原始数据关于人物的文章 -sources/-people/主要主题是人物会议产生的公司信息只放meetings/- 同时更新companies/实体传播是强制的关于公司的研究 -sources/-companies/主要主题是公司可复用框架/论点 -sources/-concepts/它是心智模型关于政策的推文串 -media/-civic/或concepts/media/ 用于内容运营唯一的例外sui generis是合成输出针对单一来源且特定读者的个性化产物如 book-mirror 的media/books/slug-personalized.md格式前缀路径是被认可的例外但原始摄取永远不适用。6.1 文章与网页内容输入用户分享的 URL或对话中提到的文章。流程抓取内容web_fetch→ 抽取标题/作者/出版物/日期/全文 → 总结执行摘要 关键论点不是复述→ 抽取实体 →保存原始来源溯源→为用户分析不只是总结而是结合已知信息指出有趣之处、连接、矛盾、内容机会。写入位置按归档规则——关于人物 -people/、关于公司 -companies/、可复用框架 -concepts/、原始数据 -sources/。专门的 idea-ingest 技能skills/idea-ingest/SKILL.md在此之上还有一条强制要求作者必须建 people 页Anyone whose thinking is worth ingesting is worth tracking并返回page_path、author_path、cross_links、status四元组给调用方。6.2 视频与播客输入URLYouTube、播客等或本地音视频文件。流程获取转录尽量做说话人分离如 Diarize.io 提供带说话人标签、词级时间戳的服务→保存原始转录JSON 和可读 TXT 都要→ 分析执行摘要、关键想法、带说话人归属的关键引语、值得注意的故事/轶事、提及的人物公司→ 抽取并交叉引用所有实体。硬性规则每个视频/播客大脑页面必须链接到原始分离转录——没有转录链接的页面是不完整的。写入位置为media/videos/或media/podcasts/并反向链接所有实体。质量门槛引人入胜的标题不是 This video discusses...、让人想看的执行摘要、真正的洞察而非话题标签、带真实说话人姓名的逐字引语不是 speaker_0、所有实体都带上下文抽取并反向链接。media-ingest 技能skills/media-ingest/SKILL.md在此补充了实用错误处理YouTube 自动字幕常拼错专有名词必须与现有大脑页面交叉核对后再建新页无说话人分离的多说话者转录价值很低应显著标注限制而非把全部发言归给一人超过 2 小时的音频可能超时需先分块。6.3 PDF 与文档输入文件路径或 URL。流程抽取文本扫描件/图片 PDF 做 OCR→ 保存原始来源 → 总结执行摘要 关键章节 值得注意的数据→ 抽取实体 → 从实体页交叉引用。写入位置按归档规则按主要主题而非格式。media-ingest 补充扫描 PDF 的 OCR 质量参差不齐若可读性 80% 应向用户标记而不是摄入垃圾内容超过 500 页的书按章节总结不内联全文链接到原始上传。6.4 截图与图片输入图片文件。流程分析内容文字密集图做 OCR照片做描述——推文截图则抽取文字/作者/日期并路由到社交媒体工作流文章截图则抽取文字并路由到文章工作流数据/图表则抽取数据点并描述发现。写入位置取决于内容——路由到上述对应工作流。6.5 会议转录实体传播是强制的输入会议录制服务的转录或手动笔记。流程拉取完整转录以转录为真相来源——AI 摘要可信度为中低→保存原始转录溯源→ 写会议页你的分析在上方、原始转录在下方 →实体传播MANDATORY对每个与会者和被讨论的公司——若出现新信息则更新其 State 区块向时间线追加指向会议页的条目若人物/公司重要且无页面则创建 →会议在全部实体页更新前不算完整摄入。写入位置meetings/YYYY-MM-DD-short-description.md。好会议页的标准揭示真正的核心不是要点堆砌连接到现有大脑页面人物、公司、交易标出变化状态、决策、新信息点明张力或未说出口的内容捕捉真实动态而非表演式总结。专门的 skills/meeting-ingestion/SKILL.md 把这条工作流扩展成了完整管线任何录音器 → 标准转录记录 → 多会议拆分 → 按证据解析说话人 → 建页 → 一致性检查 → 富化每个实体 → 验证清单内容与顺序。其中几个机制值得留意标准转录记录normalized transcript record统一 YAML 形状三个不变量——raw_transcript_text必须完整不截断、attendees只是来源的声明被邀请 ≠ 在场、source_summary经过两层有损语音转文字 AI 摘要必须验证拆分检测一次录音常常包含多场背靠背会议roster 变化、话题硬切、上下文重置都是拆分信号按证据解析说话人绝不猜测不确定就写[Room]或UNKNOWN并标记内容身份检查——如果某说话人以自己的话宣称的角色与大脑页面既定身份矛盾说明录音器张冠李戴应按身份而非名字重归属V1–V6 验证清单内容必要章节有实质内容、slug 有页面且有时间线回链、说话人映射已解析、引语逐字可锚定、防虚构与会者、顺序验证PHASE_INVERSION 与 TELEPORT 是硬性阻断项可通过用户明确 waive 放行但必须记录。结论是 A meeting is NOT fully ingested until …——验收后置是这套技能体系的共同特征。6.6 社交媒体内容输入推文、推文串或社交帖子。流程抓取完整内容推文串、引用推文、上下文→ 有图片则用视觉模型 OCR 做全文抽取 → 总结说了什么、为什么重要、涉及谁→ 抽取实体并更新大脑页面 →包含指向原帖的直接链接引用强制要求。写入位置日常聚合放media/x/若帖子主要关于某人/公司则放实体专属目录。7. 原始来源保留Raw Source Preservation可验证性的基石每一项摄入内容都必须保留原始来源用于溯源。原文档给出了统一命令gbrain files upload-raw file --page page-slug --type type自动大小路由 100 MB 的文本/PDF留在 git 仓库中大脑仓库的.raw/侧车目录 100 MB 或媒体文件视频、音频、图片通过 TUS 可恢复上传进入云存储大脑仓库留下.redirect.yaml指针文件。.redirect.yaml指针格式target: supabase://brain-files/page-slug/filename.mp4 bucket: brain-files storage_path: page-slug/filename.mp4 size: 524288000 size_human: 500 MB hash: sha256:abc123... mime: video/mp4 uploaded: 2026-04-11T... type: transcript访问已存文件gbrain files signed-url storage-path # 生成 1 小时有效的签名 URL用于查看/分享 gbrain files restore dir # 从云存储下载回本地此外put_raw_data用于在大脑中存储原始 API 响应与元数据JSON 而非二进制。源码佐证这条命令链在 src/commands/files.ts 中有完整实现——runFiles分发restore、upload-raw、signed-url三个子命令upload-raw的用法与错误分支文件不存在、--page缺失、无法解析大脑仓库目标都被显式处理restoreFiles支持逐文件恢复并统计成功/失败数量。命令用法字符串明确为upload-raw file --page slug [--type type] [--no-pointer]--no-pointer允许不写指针文件。根据 skills/_brain-filing-rules.md 的补充 100 MB 的文件使用 TUS 可恢复上传6 MB 分块带重试以保可靠命令返回 JSON——小文件为{storage: git}云存储为{storage: supabase, storagePath, reference}。8. 批量前先测试边际成本趋近于零处理多个项目批量视频摄入、批量会议处理等时原文档给出硬性流程先测 3–5 个项目。有测试模式就跑测试模式读实际输出。质量好吗标题吸引人吗不是 This video discusses...实体抽取并反向链接了吗格式干净吗修复方法/技能层面的问题而不是用一次性补丁修单个输出然后才批量执行带节流每 5–10 个项目提交一次。原文档给出了一个极具说服力的成本论证The marginal cost of testing 3 items first is near zero. The cost of cleaning up 100 bad pages is enormous.先测 3 个的边际成本趋近于零清理 100 个坏页面的成本是巨大的。skills/enrich/SKILL.md 的批量富化规则与此完全同构先测 3–5 个实体、只读实际输出、测试通过才批量、同一来源 3 实体考虑批处理或派生子 Agent、节流 API 调用、批量运行中每 5–10 个提交一次、批量后保存报告。9. 质量规则汇总执行摘要必须更新到 compiled_truth不只是追加时间线State 区块是重写而非追加——只保留当前最佳理解时间线条目逆时间序最新的在最前每个被提及的人物/公司若重要就建页见归档规则链接类型knows、works_at、invested_at、founded、met_at、discussed来源归属每条时间线条目都含[Source: ...]引用反向链接每个实体提及都产生反向链接Iron Law归档按主要主题归档不按格式或来源见归档规则。10. 反模式五个必须避开的坑向 State 区块追加内容——State 每次更新都应以当前最佳理解重写只追加的 State 会变陈旧且自相矛盾摄入而不建反向链接——未链接的提及就是破碎的大脑跳过原始来源保留——没有溯源的大脑页面无法验证不抽样测试就批量处理——先测 3–5 个质量问题修方法而非打补丁转述用户的原创思考——用户的精确语言就是洞察想法/论点/框架要逐字捕获。这些反模式与 skills/idea-ingest/SKILL.md 的扩展版高度一致后者还额外禁止只总结不连接大脑知识、跳过作者 people 页、摄入前不检查大脑已有覆盖、覆盖现有页面而非合并、创建concepts/strategy这类泛化 slug应具体如concepts/flywheel-effects、假设抓取成功而不验证实际获取了内容。11. 输出格式可审计的摄入报告每次摄入结束按以下模板向用户报告INGESTED: [title] Page: [slug] Type: [person / company / meeting / media / concept] Source: [source description] Entities detected: N - [entity] - [created / updated] ([slug]) Back-links created: N Timeline entries: N Raw source: [preserved at path / uploaded to cloud]这套格式让每次摄入都可审计页面、类型、来源、实体处理结果、反向链接数、时间线条目数、原始来源去向一目了然。meeting-ingestion 在此基础上加了验收报告约定Meeting ingested: N attendees enriched, N entities updated, N action items captured. Verification: passed. Sequence: PASS.——若顺序检查被用户 waive 必须显式说明 Sequence: WAIVED by user — {contradiction} stands若任何检查项无法通过则报告 NOT ingested 并点名失败项。先宣布已摄入再事后修补是契约违约虚假的完成报告比诚实的部分完成更糟。12. 工具清单与底层机制Ingest 技能使用的工具与其底层 gbrain 命令对应技能内工具对应能力说明get_page读取大脑页面检查实体页是否存在put_page存储/更新页面写入与更新触发 auto-link 后置钩子add_timeline_entry添加时间线条目事件记录需显式调用add_link链接实体创建交叉引用边get_tags / add_tag标签管理页面打标put_raw_data存储原始数据原始 API 响应/元数据JSONget_backlinks检查反向链接验证 Iron Law 是否落实一个值得注意的底层机制记录在 skills/enrich/SKILL.md 的 v0.10.1 说明中页面之间的链接在每次put_page时由 auto-link 后置钩子自动创建put_page 响应携带auto_links: { created, removed, errors }而 MCP 写入stdio 与 HTTP返回auto_links: { skipped: remote, hint }边由 serve 维护清理或gbrain sweep --once调和需要立即生效的边用add_link。时间线条目仍然需要显式的gbrain timeline-add调用——auto-link 只处理链接不处理带日期的事件。同理meeting-ingestion 也注明gbrain put写入会议页后auto-link 会自动为Name引用的与会者创建attended链接无需手动gbrain link但gbrain timeline-add仍必须显式执行。13. 与兄弟技能的协作边界idea-ingestskills/idea-ingest/SKILL.md链接/文章/推文/想法的专门化入口强制作者 people 页返回结构化结果media-ingestskills/media-ingest/SKILL.md视频/音频/PDF/书籍/截图/GitHub 仓库的多格式入口覆盖 video-ingest、youtube-ingest、book-ingest 子类型meeting-ingestionskills/meeting-ingestion/SKILL.md统一会议管线含拆分、去重、说话人解析、一致性检查与 V1–V6 验证enrichskills/enrich/SKILL.md分三级的实体富化协议从情报卷宗视角丰富人物/公司页What They Believe / What Theyre Building / What Motivates Them / Hobby Horses 等纹理区块signal-detectorskills/signal-detector/SKILL.md可选的常驻环境捕获专注用户原创思考与实体提及规则底座skills/_brain-filing-rules.md归档 重要性门槛 Iron Law 引用 原始来源与 skills/conventions/quality.md跨技能质量约定。所有摄取技能共享同一套规则底座这正是 Ingest 路由设计的价值无论内容从哪条通道进来最终都以一致的引用、反向链接与溯源标准落入大脑图谱。对运行 gbrain 的 Agent 而言把 skills/ingest/SKILL.md 的六阶段管线、实体检测循环与批量前测试纪律内化为默认行为就是让个人大脑从存储笔记升级为复利知识图的关键一步。【免费下载链接】gbrainGarrys Opinionated OpenClaw/Hermes Agent Brain项目地址: https://gitcode.com/gh_mirrors/gb/gbrain创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →