xiaobei 公众号对标账号基准(Benchmark)机制:基于 content-calibrator 的内容校准闭环实战
发布时间:2026/9/27 21:44:30 锦皓数字建站
机制:基于 content-calibrator 的内容校准闭环实战`)
人工智能AI Agent大模型AI 应用媒体生成【免费下载链接】xiaobei为OPC/中小微企业量身打造的自媒体获客智能体项目地址https://gitcode.com/gh_mirrors/wi/xiaobei点击查看免费下载导读本文围绕 xiaobei 开源仓库中微信公众号平台的 benchmark.md对标账号基准文件完整讲解这套对标账号 → Pattern 提炼 → rubric 信号 → 内容校准闭环的运作机制它由 content-calibrator 内容校准技能 的 LearnFrom 操作维护是外源校准的核心入口。读完本文你将掌握对标数据的落盘结构、导入对标账号的完整操作链路init.sh→ viral-chaser 追爆 →import-viral-chaser.sh、对标信号如何反哺统一的 7 维评分公式以及它在打分盲预测 → 发布 → 记录 → T3d 复盘 → 进化 rubric闭环中的位置与读写权限边界。一、Benchmark 文件在校准体系中的定位1.1 三个平台级数据文件的职责分工在 xiaobei 的 calibration 目录中每个平台如wx_mp、xhs拥有三个专属数据文件它们不包含 rubric 公式、不包含预测、不包含阈值只承载平台侧的事实输入文件职责读写权限.platform-state.jsonbaseline / enabled / content_form 等平台状态脚本读写audience.md受众画像从复盘评论聚类派生blind sub-agent 不可读benchmark.md对标账号列表 Pattern 提炼blind sub-agent 不可读从 SKILL.md 的文件结构 可以看到完整的归集原则workspace/calibration/ ├── rubric_notes.md # 统一评分公式blind sub-agent 可读 ├── rubric-memo.md # 统一观察记录blind 不可读 ├── .cheat-state.json # 统一 rubric 循环状态mode/samples/bump/score_threshold ├── wx_mp/ # 平台专属*数据*无 rubric、无 predictions、无 threshold │ ├── .platform-state.json # baseline / enabled / content_form │ ├── audience.md # 受众画像 │ └── benchmark.md # 对标账号核心设计理念一个作品 一个打分 一个预测 一个复盘。作品的内在内容质量与发布平台无关因此 rubric 公式全平台统一平台差异baseline 量级、受众、对标账号只作为预测的输入数据按平台保留。这就是 benchmark.md 为什么放在calibration/platform/下而不是根级的原因。1.2 benchmark.md 的具体结构当前仓库中 wx_mp 的 benchmark.md 是初始化模板xhs 版本 同构包含两个核心小节对标账号列表记录导入的对标账号本身初始为暂无运行导入对标添加Pattern 提炼从对标内容中提取的结构 pattern如开头方式、转折技巧、金句模式等公众号侧还可扩展封面风格、标题写法、话题标签策略等。这份文件由 content-calibrator 的LearnFrom操作维护——用户说导入对标 --platform xxx或learn from即触发。二、对标账号从哪来LearnFrom 的三个数据源根据 SKILL.md 的 LearnFrom 章节对标数据有三个来源viral-chaser 追爆报告已下载的爆款视频/文章分析 → 提取结构 pattern用户提供的数据手动粘贴对标账号数据published-track DB 中的历史数据该平台已发布内容的互动数据。导入对标后对标数据按平台写入calibration/platform/benchmark.md提炼出的 rubric 信号则进入统一的 rubric-memo.md。需要特别强调的是内源校准与外源校准的互补关系SKILL.md 原文复盘是拿实际数据验证预测提炼观察可能触发 rubric 升级导入对标是从外部信号校准 rubric 的初始假设。复盘是内源校准对标是外源校准。三、操作链路从初始化到导入对标3.1 第一步初始化平台校准目录init.sh是幂等的初始化脚本已存在则跳过首次调用会同时创建根级统一 rubric./skills/content-calibrator/scripts/init.sh --platform wx_mp从 init.sh 源码 可以看到它做了四件事若根级calibration/rubric_notes.md不存在 → 创建统一 rubric v07 维公式模板创建calibration/rubric-memo.md与calibration/.cheat-state.json含mode: cold-start、calibration_samples: 0、score_threshold: 0等字段创建calibration/wx_mp/平台目录并生成.platform-state.jsonenabled: true、baseline_plays: null等关键细节在平台目录内创建rubric_notes.md软链指向根级统一 rubric——这是为了保证 blind sub-agent 无论从根级还是平台路径都能读到同一份公式单一事实源始终是根级文件ln -s ../rubric_notes.md $CAL_DIR/rubric_notes.md生成 audience.md 与 benchmark.md 两个空模板。注意Agent 不得自主初始化校准必须用户明确要求初始化校准或我要做 XX 平台。3.2 第二步导入对标账号两种触发路径用户主动提供对标数据→ 交互式问答后写入 benchmark.md有 viral-chaser 追爆报告→ 调用 import-viral-chaser.sh./skills/content-calibrator/scripts/import-viral-chaser.sh --platform douyin output_videos/douyin-7389abc/追爆报告.md从脚本源码看它做了完整的参数校验平台必须已 init、报告文件必须存在随后从报告中正则提取平台、标题、播放量等关键信息以追加方式写入calibration/platform/benchmark.md每条记录包含来源viral-chaser 追爆报告、导入平台、导入时间、播放量、报告路径Pattern 提炼占位结构 pattern / 开头方式 / 转折技巧 / 金句模式 / 互动钩子由 agent 从报告中分析填充Rubric 信号占位对当前 rubric 维度的启示如高 ER 高 HP → 高流量。脚本本身只负责落盘结构真正的 Pattern 分析与 rubric 信号提炼由 agent 结合报告内容完成。3.3 对标信号如何反哺 rubric对标分析提炼出的信号最终汇入统一calibration/rubric-memo.md作为未来 Rubric 升级Bump的依据。升级必须走完整验证流程# 1. blind sub-agent 用新公式对最新 10 篇作品盲重打 # 2. 脚本验证降幅 ≥30% 才算通过 ./skills/content-calibrator/scripts/validate-rubric.sh --new-scores /tmp/new-scores.json且维度和权重变更必须满足用户主动要求或 Agent 提议 用户明确确认——Agent 不得自动升级 rubric 或修改阈值。四、7 维评分公式对标信号作用的落点对标账号提炼出的 Pattern开头方式、金句模式等最终要落到 统一 rubric_notes.md 的 7 个维度上打分。当前 v0 公式维度代号0 分5 分权重情感共鸣ER纯信息罗列无情感触点读者强烈代入说的就是我有具象画面或经历×1.5钩子强度HP标题平庸开头无悬念标题/开头一句话锁定注意力制造信息差或反差×1.5社会议题共振SR纯个人/产品向无社会讨论触及当下社会讨论有立场可议×1.5金句密度QL全文无独立可传播的表达≥3 句可脱离上下文独立传播的金句×1.0叙事性NA纯观点堆砌无故事弧线清晰的起承转合读者被故事牵引×1.0受众广度AB极窄垂直仅特定人群关心跨人群普适如搞钱、职场、AI焦虑×1.0实用价值PV纯情绪/观点无可操作信息读者可获得具体方法/工具/步骤×1.0综合分公式composite (ER×1.5 HP×1.5 SR×1.5 QL NA AB PV) / 8.5 × 2.0归一化常数 8.5、缩放因子 2.0理论范围 0–10整数维度分composite 保留两位小数。打分脚本 score-only.sh 只做算术、门禁与落盘不做 LLM 打分——打分和预测由 agentinline 或 blind sub-agent完成./skills/content-calibrator/scripts/score-only.sh \ --platform wx_mp \ --content-path output_articles/xxx/article.md \ --cal-er 3 --cal-hp 4 --cal-sr 3 --cal-ql 4 --cal-na 3 --cal-ab 4 --cal-pv 2返回 JSON 含passed与failing_dims阈值取根级.cheat-state.json的score_threshold全局默认 0不拦截每维需 阈值才算通过。五、对标/受众信息的隔离纪律为什么 benchmark.md 不可读在打分盲预测流程中隔离规则 是保证预测可信度的生命线白名单只读稿件script.md/article.md/post.mdcalibration/rubric_notes.md硬禁读rubric-memo.md、.cheat-state.json、各work/calibration/、audience.md、benchmark.md、对话历史。原因很直接如果打分者已经看过对标账号的爆款 Patternbenchmark.md和受众画像audience.md打分就会事后诸葛丧失盲预测的校准价值。预测必须是真正的事前赌——blind sub-agent 没看 actuals/history/audience 时产出的 bucket/probability/counterfactual/assumptions 才有统计意义。派发策略按会话场景区分SKILL.md会话场景打分方式理由交互式会话主 agent 有对话/复盘上下文sessions_spawnblind sub-agent主对话被污染需 spawn 硬隔离定时 / isolatedSession发布 cron、heartbeat主 agent inline 打分不派 subagent全新对话无上下文发布前无实际数据天然满足盲条件六、校准闭环全景benchmark 在循环中的位置把以上内容串起来就是 xiaobei content-calibrator 的完整闭环SKILL.md 核心闭环 打分盲预测 → 发布 → 记录(1B) → T3d 复盘 → 进化 rubric │ ├─ 3a: 单篇复盘批量retro.md rubric-memo.md └─ 3b: 综合评估detect-bump-signals.sh 混杂因素 建议各阶段的对标/基准数据介入点Init / LearnFrom对标账号写入calibration/wx_mp/benchmark.md外源校准 rubric 初始假设打分盲预测1A基准/受众文件对打分者不可见保证盲预测纯净发布前经score-only.sh阈值门最多 2 轮改稿仍不达标暂停发布上报用户发布记录1B由 published-track 承接record.sh直接从work/calibration/score.json读分T3d 复盘3a/3b对比预测 vs 实绩观察写入统一rubric-memo.mddetect-bump-signals.sh做纯 DB 偏差检测维度分≥3 但 actual≤2高估≤2 但≥3低估同向 ≥3 触发 bump 信号Agent 需评估混杂因素同账号/同平台/跨平台后才可建议升级Bump用户发起新公式 → blind 盲重打 10 篇 →validate-rubric.sh验证降幅≥30%→ 落地归档。Agent 不得自动升级。复盘阶段的数据全部来自 published-track DBquery-retro-pending.sh已带出待复盘作品的互动数据不另行抓取。七、实操清单与 FAQ7.1 快速上手四步# 1. 初始化幂等首次同时创建统一 rubric ./skills/content-calibrator/scripts/init.sh --platform wx_mp # 2. 查看/启用平台校准开关 ./skills/content-calibrator/scripts/cal-toggle.sh --list ./skills/content-calibrator/scripts/cal-toggle.sh --platform wx_mp --enable # 3. 导入对标viral-chaser 追爆报告 ./skills/content-calibrator/scripts/import-viral-chaser.sh --platform wx_mp report-path # 4. 打分落盘预测cold-start 期只给 7 维分 一句话 bet ./skills/content-calibrator/scripts/commit-prediction.sh \ --work-dir output_articles/xxx --platform wx_mp \ --cal-er 3 --cal-hp 4 --cal-sr 3 --cal-ql 4 --cal-na 3 --cal-ab 4 --cal-pv 2 \ --prediction-file /tmp/prediction-draft.md7.2 常见问题Qcold-start 期前 5 个作品预测要出 bucket 吗不需要——只给 7 维分 一句话 betbucket 数字是 false precision第 5 个作品复盘后按实绩数据派生 bucket 边界。Q对标账号能读我的打分记录吗不能。benchmark.md 与 audience.md 一样对 blind sub-agent 不可读二者与 rubric-memo、.cheat-state同属隔离清单。Q平台未启用 calibration 怎么办calibration/platform/.platform-state.json不存在或enabledfalse时跳过打分直接发布是否启用必须由用户决定Agent 不得自动启用。Q对标数据应该放根级还是平台目录平台目录。对标是平台侧输入各平台对标账号量级/风格不同rubric 公式才是全局统一——两者不可混放。八、总结xiaobei 的 benchmark.md 看似只是一个对标账号记录文件实则是内容校准闭环中外源校准的关键节点它以calibration/platform/benchmark.md承载对标账号与 Pattern 提炼由 content-calibrator 的 LearnFrom 操作维护信号最终汇入统一 rubric-memo.md 反哺 7 维评分公式。它严格遵循三条不可妥协原则——盲预测写完即 immutable、升级需盲重打验证10 篇 validate-rubric.sh 降幅达标才落地、rubric 是工作台不是博物馆被推翻的观察删除git history 是档案——从而保证打分、预测、复盘的可信闭环让对标账号真正成为校准而非作弊的数据源。赞分享人工智能AI Agent大模型AI 应用媒体生成【免费下载链接】xiaobei为OPC/中小微企业量身打造的自媒体获客智能体项目地址https://gitcode.com/gh_mirrors/wi/xiaobei点击查看免费下载相关推荐小红书对标账号库Benchmark实战xiaobei 内容校准闭环中的对标信号与 Pattern 提炼小红书对标账号库Benchmark实战xiaobei 内容校准闭环中的对标信号与 Pattern 提炼 本文聚焦 xiaobei小贝开源仓库中内容校准人工智能AI Agent大模型AI 应用媒体生成xiaobei Content Calibrator 内容校准预测循环打分、盲预测、复盘与 Rubric 自进化的完整实战指南xiaobei Content Calibrator 内容校准预测循环打分、盲预测、复盘与 Rubric 自进化的完整实战指南 本文围绕 xiaobei为人工智能AI Agent大模型AI 应用媒体生成EasyWeChat 多公众号多账号接入实战指南基于 id 路由的账号隔离方案EasyWeChat 多公众号多账号接入实战指南基于 id 路由的账号隔离方案 本指南以 EasyWeChat 4.x 官方文档「多账号接入」为核心讲解后端即时通讯上一篇Visual C运行库一键修复工具如何快速解决Windows软件兼容性问题下一篇3步修复VisualCppRedist AIO一键解决Windows运行库缺失问题创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。