Daily Dialogue Engineering Note
2026-08-20 → 2026-09-04 · 脱敏分享版
DeepSeek × Agent Runtime × Evidence Engineering

把概率模型变成一间可稳定交稿的编辑部

两周构建 Daily Dialogue 的工程实录:从 Prompt 堆叠、多 Agent 扩张和偶发好稿,走向证据完整、运行时可纠偏、可回滚且可持续评测的人机协作叙事系统。

2/7 → 7/7七日机械交付率,从频繁失败到完整出稿
97.15七日内容均分,基线 94.42;候选赢 5 天
23 / 14运行时干预 / 成功恢复,Harness 确有实效
31/31七月离线影子回填完成,零终止失败

核心结论

这不是一次“把 Prompt 写得更长”的成功。真正有效的变化,是把证据、状态、完成条件、恢复预算和版本晋级从模型脑中移到运行时;同时把主线选择、个人语气和叙事开放性留给模型。

三个最高收益决策

状态替代提醒。 “读完整再结束”从提示词变成可执行完成条件。

完整来源替代固定 Top-K。 写手可看精选材料,事实台必须知道完整边界。

三轨替代覆盖式升级。 Stable 保底、Progressive 稳步演进、Frontier 承担激进试验。

尚未完成的部分

最新 V230 只进入了本机 Progressive Shadow,真正的七个自然日在线门禁仍待完成。

七八月 VPS canonical Markdown 已核验为 31/31,但 Notion 回填证据不完整,不能宣称已全部补齐。

问题本质:不是写作,而是重建一天

输入同时来自作者对话、足迹、图片、支付、健康汇总、工作事件和长期记忆。它们的粒度、可信度和叙事价值完全不同。一个高密度日期可以有 632 条可用 claim,固定取前 64 条会让系统产生危险的“伪完整”。

来源层主要价值不能忽略的风险
作者表达
主线
决定哪些事情值得记、怎样理解当天口语省略、语音 typo,且晚间回顾不一定每天存在
行为锚点
ground truth
校正时间、地点、消费和身体状态设备数据不能替代主观叙事
图片场景
生活细节
补足餐饮、家庭互动和环境信息孤立识图容易机械,必须绑定事件上下文
工作记录
技术主线
还原决策、完成结果和方法论数量大,容易挤掉普通生活
长期记忆
意义
解释事件为什么重要不能把长期画像写成当天新事实

关键判断:这同时是事件重建、来源权威、叙事规划、长流程可靠性与持续交付问题。单纯优化向量召回或模型文笔,都不足以解决。

两周演进:先扩张,再收敛

08/20–21
建立国际编辑室用总编、事实台、主笔和治理评审明确职责;历史角色只作 UI 隐喻,模型执行使用中性合同。
08/22–24
加入 AgentSpec 风格 Harness把读全、补证、章节完整和禁止提前结束变成 Trigger → Check → Enforce。
08/25–27
DeepSeek-first 与有界 SOTA 救援七日从 2/7 恢复到 7/7;Codex 只在完整前置条件和预算耗尽后救援一次。
08/28–30
根因从“主题”深入到“角色与权威”增加 typed evidence binding,处理本人主张、系统推断、计划与完成状态之间的混淆。
08/31
确认长编辑链自身会劣化更多 handoff 让每个角色重复判断重要性;流程缩短为紧凑编辑室。
09/01–02
作者锚点改为 sidecar不再替换基础证据;加入 A/A、随机顺序安慰剂和配对盲评思路。
09/03
V230 收敛并注册 Shadow离线、独立模型和人工均通过后停止微调,进入七个真实日期验证。
09/04
把人工判断编译成正文义务高价值遗漏不再停留在聊天意见里,而是绑定输入哈希、原始 claim 和最终可见正文;交付面首次真实拦截下游语义回归。

最终架构:底盘确定,上层开放

确定性程序负责

哈希与血缘、引用映射、阶段状态、重试预算、幂等、必需章节、权限门、版本和回滚。

模型负责

话语行为、事件拆解、跨源聚合、主线优先级、语音 typo、自然第一人称和语义质量。

Harness:让“应该完成”变成“没有完成就不能结束”

Trigger事实台准备说“无证据”或主笔准备交稿
Check完整来源回执、章节、绑定与预算是否满足
Enforce阻止结束、补查、章节修补、降级或 fail closed
Trigger: fact_desk.finish
Check:   all_required_sources_acknowledged
         AND absence_claim_has_coverage_proof
Enforce: request_missing_sources
         OR mark_unavailable

Trigger: writer.finish
Check:   required_sections_present
         AND primary_storyline_covered
Enforce: one_bounded_section_patch
         # 禁止无上限整稿重写

七日候选中记录到 23 次干预、14 次成功恢复。它拦截过空输出、不合 Schema、局部证据导致的错误 absence、缺少核心章节和提前 finish。状态写入 SQLite/JSON,即使消息被压缩,也不会遗忘当前阶段。

Harness 的边界:它能保证完整执行和合法证据,不能保证故事本身有价值。叙事判断仍依赖 Blueprint、主笔和独立语义审稿。

自进化:一条受控实验链,不是让 Agent 随意改自己

Freeze
冻结 bad case、输入哈希、配置、输出和人工反馈。
Diagnose
区分基础设施、模型空输出、流程漂移、证据绑定和叙事质量。
Experiment
一次改变一个机制;预注册样本、指标、晋级与停止条件。
Evaluate
A/A 测噪声,A/B 与安慰剂测因果,独立模型与人工盲评。
Promote
只晋级到 Progressive Shadow;Stable 保持冻结,失败可一键回滚。

最典型的纠偏:作者回顾本来是好信号,但第一版把它用来替换基础证据,结果恢复了一批锚点事件,同时丢掉另一批事件。独立评审将问题定性为“替换机制有害”,于是改成只追加优先级 sidecar。这个改动保留了作者意图,也不破坏来源覆盖。

被遗漏的核心信号:人类在改变目标函数

Codex 对话中最有价值的输入,不是一次次逐句改稿,而是人类多次改变了系统的优化方向。什么值得记、什么必须阻断、什么可以带着修订状态交付,以及什么时候应该停止继续优化,这些都无法从局部 loss 或自动评分中自行推出。

人工裁决纠正的局部最优编译后的系统资产
冻结已认可稿为保底锚点新实验持续覆盖上一版好稿Stable 哈希、回滚点、金标回归
建立 Stable / Progressive / Frontier 三轨所有创新挤在一条可变流水线上独立晋级权和生产写入门
质量高于耗时与成本为缩短上下文牺牲生活细节动态证据预算、有界长超时
作者回顾是主锚点,但不是必需输入要么忽略回顾,要么把它做成死门禁priority sidecar 与无回顾 fallback
硬错误阻断,小疑点进入 revise追求绝对正确让高质量稿也无法交付hard error / revise / deliverable 分级
晋级前做 A/A、A/B、跨日与盲评单次高分被误当成稳定提升预注册评测、噪声基线和停止条件
核心遗漏要精确保留宽泛 Prompt 和来源覆盖仍漏掉高价值事件claim-bound owner obligations
回到稳定交付与历史回填围绕单个例外无限打补丁目标层级、WIP 上限和收敛门槛

人工不是流水线节点,而是效用函数的传感器

Agent 可以自主决定

证据检索、事件聚合、写作、局部修复、跨日回归和有界恢复。前提是目标、证据边界、预算和完成谓词已经冻结。

仍需人类校准

长期价值、偏好冲突、金标选择、发布边界、评估盲区,以及何时冻结、回滚、换假设或停止实验。

把聊天意见编译成可执行资产

一次真实拦截:9 月 4 日,人工确认的高价值遗漏被绑定到输入哈希和原始 claim。下游版式处理随后改坏了一个关键称谓,交付阶段重新检查最终可见正文,阻断回归并保留正确的上游版本。人工只判断了一次,之后由运行时持续执行。

转契约率多少人工裁决成为 rubric、obligation、gate 或 stop condition
复发率同类错误是否还需要人类重复指出
Steering Leverage一次人工决策保护了多少次后续自动运行

不再以“点了多少次确认”衡量协作,而以每篇可交付稿所需人工分钟数和上述杠杆指标衡量。目标是让人类持续教系统,而不是长期替系统打工。

查看脱敏决策账本 JSON →

实验结果

七日交付与内容

候选内容均分
97.15
基线内容均分
94.42
候选机械交付
7/7
旧状态机械交付
2/7

七日 API 平均约 $0.0397/天,中位耗时约 10.7 分钟,最长约 18.7 分钟。质量目标高于秒级时延;国产模型承担主流程,Codex 整稿救援只发生 1 天。

七月 HomeMac 新稿 vs VPS 旧稿

严格同日可比样本只有 4 天,以下结论不能外推为整月模型分数。

日期HomeMac 新稿VPS 旧稿差值决策
07-0296.2575.63+20.63advance
07-0799.3891.88+7.50advance
07-1099.3886.88+12.50revise:绑定风险
07-1398.4482.50+15.94advance
平均98.3684.22+14.144/4 胜出

七月 31 天离线影子 Reader 已 31/31 生成、31/31 完成语义审阅、0 终止失败;但这些运行明确禁止 canonical 写入。

V230 收敛证据

机器与独立模型

冻结七日 7/7;独立内容评估 7/7 advance;五个维度均不低于 4/5;33 项聚焦回归通过,后续实现回执扩大到 39 项。

真实日期与人工

9 月 2 日完成 11 阶段、来源和语义审计、27 张图片;3 篇人工审阅为 1 篇直接保留、2 篇小改后保留。

最有价值的是失败样本

看似合理的做法为什么失败最终替代
固定投影 64 条把“没看到”误当成“没有”,且无法适应每日密度动态预算、类别覆盖、完整目录和按需补读
增加更多 Agenthandoff 增加随机点,多次重算重要性只保留可独立验收、可单独重试的子任务
正则判断可读性技术词与正常推测被误判为流水线话术代码验机械属性,独立模型验语义
只看一个综合分高分区间饱和,评估器自身存在漂移A/A、配对偏好、硬错误和人工价值判断
作者总结替换基础证据锚点恢复与非锚点遗漏形成零和交换作者优先级 sidecar,不改基础证据集
追求 100% 才发布小问题让整篇归零,门禁越来越重硬错误阻断;可修订问题进入 Shadow revise

外部方法怎样真正落到工程里

AgentSpec

启发 Trigger、Check、Enforce 的运行时拦截。项目采用其语义,但没有为了形式而强依赖 DSL。

Chain-of-Evidence

每个重要 claim 既要有链,链也要真正支持 claim;引用不能在成稿后装饰性补上。

W3C PROV

来源、派生产物和执行活动都显式建模,支持审计、删除、重放与版本比较。

FactBank

事实性与说话者立场相关,actor 与 authority 必须成为一等字段,而不只是主题标签。

Human-AI Interaction Guidelines

局部纠错、长期学习、谨慎适配、反馈后果可见和全局控制是不同控制面;一次改稿不能被误读为永久偏好。

DAgger

专家应在当前策略真正访问到的失败状态上给纠正,再把这些状态聚合进训练与评测集;这正是冻结真实 bad case 的价值。

InstructGPT

人类示范与排序能让模型更贴近特定意图;个人叙事需要 owner-specific preference,而不是抽象的平均写作偏好。

Generative Agents

完整经历记录、较高层反思和动态检索彼此互补;哪些反思重要,仍需个人价值校准。

这些理论只提供设计语言。是否采用某个机制,仍由本地冻结样本、跨日回归、独立评估和人工反馈决定。

当前状态:已收敛,但没有提前宣布胜利

Stable冻结保底

stable-v11-approved-20260809 保持不变,本轮实验没有覆盖它。

Progressive长期演进

生产仍走 V135;V230 已注册为本机 Shadow,等待七个真实日期。

Frontier激进试验

新时间线、更多子 Agent 和自适应策略先在这里验证,不影响每日交付。

七日在线门禁

  1. 七个不同真实日期均生成 Reader;
  2. 每天最多一次有界重试;
  3. 零硬事实冲突、零主线或核心生活遗漏;
  4. 零未授权外部写入;
  5. 人类按异常优先审阅,并随机抽两篇;
  6. 不允许整日丢稿。

明确缺口:Notion 不能声称完整回填。现有回执中,七月仅 26 条成功且带 URL,八月仅 4 条;需要独立补证,不能从 VPS Markdown 31/31 推导出来。

9 月 4 日新增能力:owner-confirmed 高价值遗漏可以编译为哈希绑定的正文义务,并在最终 Reader 交付面重新验收;真实重跑已经发生过一次下游回归拦截。

可以迁移到其他 Agent 项目的十条原则

  1. 先冻结保底,再创新没有可回退版本,任何优化都可能成为不可逆退化。
  2. Prompt 不是状态数据库计划、进度、证据和完成条件必须独立持久化。
  3. 没检索到不等于不存在absence 必须绑定完整来源覆盖证明。
  4. 结构与内容分门验收代码验结构,模型验语义,人验长期价值。
  5. 人审异常,不审表格默认采用高置信建议,人只修改例外。
  6. 先做 A/A,再相信 A/B没有噪声基线,就无法判断提升是否真实。
  7. 子 Agent 必须可验收不能定义输入、输出和完成谓词的任务,不值得拆。
  8. 恢复必须有界重试、章节修补和 SOTA 救援都要有预算。
  9. 作者信号决定优先级它不能独占事实,必须与设备和场景证据互补。
  10. 满足停止条件就上线观察真实流量反馈比继续修离线小样本更有价值。

结语

真正的成果不是某一篇 98 分的日记,也不是搭建了多少个 Agent,而是形成了一条可以每天交付、失败可解释、结果可回放、改坏能回滚的生产路径。

DeepSeek 承担大部分写作,SOTA 模型只在关键失败和方案复核中点石成金;Harness 保证流程完成,独立审稿保证内容值得留下,三轨版本则保证创新不会破坏每日交付。

人类也不再承担逐句改稿:真正稀缺的贡献是校准价值、发布边界和全局方向,再让系统把一次判断编译成可重复执行的契约。

下一步不再扩大编辑室,而是完成七个真实日期,让“离线能写好”变成“每天都能稳定写好”。

参考资料