# 把概率模型变成一间可稳定交稿的编辑部

> 两周构建 DeepSeek Daily Dialogue 的工程实录：从 Prompt 堆叠、多 Agent 扩张和偶发好稿，走向证据完整、运行时可纠偏、可回滚且可持续评测的人机协作叙事系统。

**记录周期：2026-08-20 至 2026-09-04**  
**适合读者：正在建设 Agent、RAG、自动报告、内容生成或多模型工作流的工程团队**  
**数据边界：本文只呈现脱敏后的系统设计、实验指标和抽象案例，不包含个人日记正文、精确位置、联系人、账号或原始传感器数据。**

---

## 摘要

Daily Dialogue 的目标看似简单：每天把聊天、位置、图片、消费、健康和工作记录写成一篇日记。真正困难的却不是“让模型写一篇文章”，而是同时满足四件事：

1. **每天能交稿**，不能因为一次空响应、断网或某个子步骤超时而整条链路归零。
2. **主线不能被数据量淹没**，生活、家庭和工作中的关键事件必须被看见。
3. **事实可追溯但文字仍像人写的**，不能为了严谨只剩流水账，也不能为了流畅随意补全。
4. **改进不能破坏已有好稿**，每次变化都要能做 A/A、A/B、盲评、回滚和晋级控制。

两周里，我们一度把流程扩成“国际编辑室”，加入多个记者、事实台、主笔和审稿角色；结果是流程更复杂，质量却未必更稳。随后系统逐步收敛为一条更短的 DeepSeek-first 主链：**完整来源清单 → 事件与作者主锚点 → Story Blueprint → 主笔 → 事实与结构审计 → 人类只审异常**。

截至 9 月 4 日，离线结果已经达到：

- 机械交付由 **2/7 提升到 7/7**；
- 七日内容评测均值 **97.15**，基线为 **94.42**，7 天中赢 5 天；
- 运行时发生 **23 次干预、14 次成功恢复**，说明 Harness 确实拦截并修复了真实漂移；
- 七月 31 天离线影子回填 **31/31 成功**；
- 七月 4 个同日配对样本中，新稿 **4/4 胜出**，均分 98.36，对旧稿 84.22，平均提升 14.14 分；
- 最新 V230 冻结七日回归 **7/7**，独立内容评估 **7/7 advance**，3 篇人工复核为 1 篇直接保留、2 篇小改后保留。

但我们没有把这些数字包装成“已经完成”。V230 当前只获准进入 **本机 Progressive Shadow**，Stable 仍冻结，真正的 7 个自然日在线验证还在进行；Notion 的七八月完整回填也没有可靠证据证明已经完成。

---

## 一、为什么这个任务比普通内容生成难

输入不是一份干净文档，而是密度、可信度和语义完全不同的多源事件流：

| 来源层 | 典型输入 | 主要价值 | 主要风险 |
|---|---|---|---|
| 作者表达 | 本人对话、晚间回顾、语音输入 | 决定主线、意义和个人语气 | 口语省略、语音 typo、回顾可能缺席 |
| 行为锚点 | 足迹时间窗、支付、健康汇总 | 校正时间、地点、消费和身体状态 | 数据粒度不同，不能直接替代叙事 |
| 场景证据 | 图片、OCR、图片语境解读 | 补足餐饮、家庭互动和环境细节 | 图片与事件可能错配，孤立识图机械 |
| 工作证据 | Clawdbot/Codex 记录、Linear 事件 | 还原技术主线、决策与完成结果 | 技术信号数量大，容易挤掉生活内容 |
| 长期记忆 | 人生本体、精选记忆、历史偏好 | 帮助理解“为什么重要” | 不能把长期画像伪装成当天事实 |

输入每天从几十条到数百条波动。一个典型高密度样本有 **632 条可用 claim**。如果固定只给模型前 64 条，看起来节省上下文，实际上会制造危险的假象：复核模型没有看到后面的图片观察或健康汇总，便错误地写出“找不到支持”。

因此，问题不能被简化为“Top-K 选得准不准”，它同时是：

- 一个**事件重建问题**：同一顿饭、同一次出行、同一场会议散落在不同来源；
- 一个**叙事规划问题**：事实多不等于都值得写；
- 一个**来源权威问题**：本人自述、设备数据和模型推断的地位不同；
- 一个**长流程可靠性问题**：任何中间节点的空输出都可能导致整篇失败；
- 一个**持续交付问题**：今天改进某类细节，不能让昨天已经解决的问题复发。

---

## 二、两周演进：从扩张到收敛

### 阶段 1：建立“国际编辑室”隐喻

最初的直觉是模拟一支优秀的人类编辑团队：总编确定主线，事实台核证，主笔写作，制作人管理版本，评审团队独立打分。这个隐喻很有价值，因为它迫使我们明确职责边界：

- **生产团队只负责生成一篇候选稿**；
- **治理团队负责架构、事实风险、叙事和工程验收**；
- 生产者不能给自己晋级，评估者也不能偷偷改稿。

但历史人物和角色只保留在 UI 与协作说明中，真正送给模型的是中性的角色契约。这样做避免了“角色扮演 Prompt”占据上下文，职责仍然可审计。

### 阶段 2：发现“更多 Agent”并不等于“更稳”

流程一度包含多份记者简报、事实台、主笔、章节修补和多轮审稿。实验暴露出三个反直觉结果：

1. 每一次 handoff 都是新的随机决策点；
2. 每个角色都会重新判断一次“什么重要”，高价值事件在层层压缩中被丢掉；
3. Harness 可以保证流程走完，却不能替团队选择一条有价值的故事主线。

问题不再是来源召回不足，而是**过长的编辑链反复重算重要性**。系统因此从“八个独立 Bot”收缩为紧凑工作室：中性总编、事实台、主笔三次主要模型调用，外加一个确定性运行时。

### 阶段 3：把 Prompt 约束变成运行时约束

Prompt 里的“请完整读取”“不要提前结束”“缺证据要补查”，本质上只是软建议。我们借鉴 AgentSpec 的 **Trigger → Check → Enforce**，在自己的 LangGraph/Runner 中实现了同语义的 Harness：

```text
Trigger: 事实台准备得出“无证据”结论
Check:   图片、健康、作者回顾等来源是否全部返回覆盖回执
Enforce: 覆盖不完整则阻止结束，补查缺失来源；仍失败则标记 unavailable
```

```text
Trigger: 主笔准备提交整稿
Check:   必需章节、主线事件、餐饮/家庭/工作覆盖和引用映射是否完成
Enforce: 只对缺失章节做一次有界修补；禁止无上限整稿重写
```

流程状态写入 SQLite/JSON，而不是依赖聊天历史。即使模型上下文被总结，系统仍知道当前处于 `FROZEN → FOCUSED → EXTRACTED → COMPARED → ACCEPT/REVISE/UNAVAILABLE` 的哪一步。

### 阶段 4：从固定 64 条改为动态证据预算

固定窗口最大的问题不是“小”，而是**与当天信息密度无关**。我们改为根据来源类别、事件簇、作者信号和风险计算投影预算，同时保留完整来源目录供事实台按需补读。

一个实际运行中，冻结输入含 165 条 claim，动态投影选择了 107 条，覆盖 17 类来源和 10 个事件上下文。这里的 107 不是新的魔法数字，而是当天特征计算的结果。

核心原则变成：

> 写作模型看到的是经过排序的叙事材料；事实复核模型必须知道完整来源边界，并能够对缺口发起补读。

### 阶段 5：作者主锚点从“替换证据”改为“优先级侧车”

本人晚间回顾往往最接近当天真正想留下的内容，因此我们尝试用 author anchor 提升主线召回。但最初的实现用锚点替换基础证据集，结果恢复了作者提到的事件，却丢掉未被回顾明确说出的高价值事件，形成零和交换。

Fable 5.1 的独立评审指出，问题不是 author anchor 概念有害，而是**替换机制有害**。最终改成 sidecar：

- 基础证据集保持不变；
- 作者回顾只提供事件顺序、重要性和主观意义；
- 没有晚间总结时，流程仍可依靠跨源事件簇与 Story Blueprint 完成，不把“必须有总结”设成死门禁。

### 阶段 6：停止微调，进入可发布候选

最后阶段最重要的决策不是继续加规则，而是使用停止条件：当冻结回归、独立模型评估和人工审阅都通过后，停止离线微调，注册为本机 Progressive Shadow，进入七个自然日的真实流量验证。

这避免了典型的“修 A 坏 B”：每发现一个例外就新增 Prompt、正则或角色，最终让系统比问题本身更难理解。

---

## 三、最终架构：底盘确定，上层开放

```text
多源采集
  │  作者消息 / 足迹 / 图片 / 消费 / 健康 / 工作事件 / 长期记忆
  ▼
来源清单与血缘
  │  source_id / 时间 / actor / authority / content_hash / availability
  ▼
事件聚合与主锚点
  │  episode clustering + author recap sidecar + typed binding
  ▼
Story Blueprint
  │  主线、事件优先级、章节预算、可省略项、待核冲突
  ▼
DeepSeek 主笔 ─────────────┐
  │                        │ 有界恢复
  ▼                        │
事实台与章节审计 ──────────┘
  │  完整来源回执 / claim-evidence / 章节覆盖 / 角色与状态绑定
  ▼
Reader 候选稿
  │
  ├─ 机器机械审计：结构、哈希、引用、权限、重复运行
  ├─ 独立语义审稿：主线、事实、生活完整性、可读性
  └─ 人类例外审阅：硬错误、遗漏、是否值得留下
```

### 哪些交给代码，哪些交给模型

**确定性程序负责：**

- 输入、Prompt、模型配置和输出哈希；
- 来源清单、可用性回执和引用映射；
- 阶段状态、完成条件、重试预算和幂等；
- 必需章节、图片附录存在性、权限与生产写入门禁；
- Stable/Progressive/Frontier 版本、回滚点和发布资格。

**模型负责：**

- 识别作者回顾、即时记录、计划、纠正和闲聊等话语行为；
- 把跨源材料聚合为人物—动作—对象—时间—地点—结果—感受事件；
- 选择当天主线、生活细节和技术思考；
- 处理语音输入 typo、同音词和隐含指代；
- 写出连续第一人称、自然且有重点的成稿；
- 判断“有证据但表达不自然”“结构合规但不值得读”等语义质量。

这条边界很关键：我们曾用正则检查“是否像人写”“是否越界推断”，结果技术词和普通叙述频繁误报。最终只让代码检查可确定事实，让独立模型审稿处理语义边界。

---

## 四、Harness 到底拦截了什么

七日候选运行中记录了 **23 次运行时干预，14 次成功恢复**。它们不是装饰性日志，而是以下真实失败：

| 触发点 | 实际漂移 | 运行时动作 | 最终结果 |
|---|---|---|---|
| 记者/提取阶段 | 返回空结果或不符合 Schema | 阻止进入下一阶段，按缺失字段重试 | 多个历史失败样本被恢复 |
| 事实台 | 只看局部投影便声称“无证据” | 检查完整来源回执，缺图片/健康即补查 | 避免错误删除真实细节 |
| 主笔结束 | 缺少消费、家庭或关键章节 | 阻止 finish，执行一次章节级补丁 | 保持全文结构而不整篇重写 |
| 长调用失败 | DeepSeek 空输出或网络中断 | 同模型有界重试；满足前置条件后才允许 Sol 救援 | 七日中仅 1 天使用整稿救援 |
| 重复运行 | 同一输入可能重复付费或漂移 | 比对冻结哈希并复用已完成产物 | 幂等重跑不新增成本 |

AgentSpec 给我们的最大启发不是照搬 DSL，而是一个工程判断：

> “模型说完成了”不是系统事实。只有持久状态中的证据、阶段和验收谓词都满足，运行时才允许结束。

同时也要承认边界：Harness 能防止漏步骤、乱序和提前结束，不能替代内容判断。故事有没有价值，仍需要正确的证据选择、主线规划和独立语义评估。

---

## 五、自进化不是让 Agent 自己改自己

本项目的“自进化”是一条受控的工程闭环：

1. **冻结 bad case**：保存输入哈希、配置、输出和人工反馈，避免问题随数据变化消失。
2. **给失败定型**：区分基础设施无效、模型空输出、流程未完成、证据缺失、绑定错误和叙事质量问题。
3. **提出最小假设**：一次只改变一个机制，例如“锚点替换”改成“锚点 sidecar”。
4. **预注册实验**：先固定样本、指标、晋级条件和停止条件，再运行。
5. **A/A 测噪声**：在判断 A/B 差异前，先知道同一方案重复评估会漂移多少。
6. **A/B 与安慰剂对照**：例如真实顺序 sidecar 对随机顺序 sidecar，证明收益来自语义而不是多了一段 Prompt。
7. **独立模型与人工盲评**：生产模型不能给自己打分；人工只看异常和随机抽样。
8. **晋级或回滚**：通过才进入 Progressive Shadow；Stable 保持冻结。

我们因此积累了几条比单个 Prompt 更重要的长期知识：

- “找不到”必须是完整来源覆盖后的结论，不是 Top-K 未命中；
- actor、authority、时间和状态是事实绑定的一等字段，不能藏在主题分类里；
- 作者回顾决定优先级，但不能替换其他来源；
- 多 Agent 的收益来自隔离任务与并行恢复，不来自角色数量；
- 独立评估必须有 A/A 噪声基线，五分制在高质量区间容易饱和；
- 基础设施错误必须记为 `infrastructure_invalid`、成本为零，不能算成模型失败。

---

## 六、被遗漏的核心信号：人类在改变目标函数

回看 Codex 协作记录，最有价值的输入并不是某次“把这句话改一下”，而是人类多次改变了系统的优化方向。这些决定回答的是模型无法从局部 loss 或自动评分中自行确定的问题：**什么值得记、什么错误必须阻断、什么问题可以带着修订状态交付，以及什么时候应该停止继续优化。**

| 人类裁决 | 当时纠正的局部最优 | 编译后的系统资产 |
|---|---|---|
| 将 8 月 9 日认可稿冻结为保底锚点 | 新实验持续覆盖旧好稿 | Stable 哈希、回滚点、金标回归 |
| 建立 Stable / Progressive / Frontier 三轨 | 所有创新挤在一条可变流水线上 | 独立晋级权和生产写入门 |
| 明确“质量高于耗时与成本” | 为缩短上下文而牺牲生活细节 | 动态证据预算、有界长超时 |
| 作者回顾是主锚点，但不是必需输入 | 要么忽略回顾，要么把回顾做成死门禁 | priority sidecar 与无回顾 fallback |
| 基本事实和可读性达标即可进入 Shadow | 追求 100% 正确导致 96 分稿也不交付 | hard error / revise / deliverable 分级 |
| 晋级前必须 A/A、A/B、跨日与盲评 | 单次高分被误当成稳定提升 | 预注册评测、噪声基线与停止条件 |
| 核心生活与家庭遗漏要精确保留 | 宽泛 Prompt 和来源覆盖仍漏掉高价值事件 | claim-bound owner obligations |
| 回到“稳定出稿与历史回填” | 围绕单个例外无限打补丁 | 目标层级、WIP 上限和收敛门槛 |

### 人工不是流水线节点，而是效用函数的传感器

Agent 可以自主完成证据检索、事件聚合、写作、局部修复和回归实验；但以下决策仍需要人类：

1. **价值定义**：什么内容对未来的自己值得回看，不能从来源数量或通用写作分数推出来。
2. **偏好冲突**：完整与易读、生活与技术、严谨与自然之间如何取舍。
3. **金标与发布边界**：哪一版已经“足够好”，什么错误阻断，什么只需标记待修订。
4. **评估器盲区**：高分但没有生活感、结构完整但漏掉当天主线，往往先由人发现。
5. **停止与转向**：局部优化长期不收敛时，决定冻结、回滚、换假设或结束实验。

这与三类成熟研究形成对应：微软的人机交互准则明确区分局部纠错、长期个性化和全局控制；DAgger 说明专家反馈在当前策略真正到达的状态上最有价值；InstructGPT 则说明特定人群的偏好反馈可以比单纯扩大基座模型更直接地改变行为。对个人 Daily Dialogue 而言，这个“特定偏好”就是作者本人，而不是一个抽象的平均用户。

### 把对话意见编译成可执行资产

```text
Codex 协作中的人工判断
  → 脱敏 Decision Ledger
  → 选择编译目标
       ├─ 价值偏好      → 评测 rubric / priority policy
       ├─ 已确认事实    → claim-bound obligation / bad case
       ├─ 发布边界      → hard gate / revise state
       ├─ 全局策略      → Stable / Progressive / Frontier
       └─ 停止条件      → promotion / rollback contract
  → 冻结回归与运行时观察
  → 新的异常再回到人类，而不是静默自改
```

9 月 4 日的一次真实重跑验证了这条链：人工确认的高价值遗漏先被绑定到原始 claim 和输入哈希；下游版式处理随后改坏了一个关键称谓，交付阶段的对称门禁没有相信“上游已经通过”，而是重新检查最终可见正文，阻断回归并保留了正确的上游版本。这说明人工信号一旦被编译为运行时契约，之后就不必每天重复提醒模型。

后续不以“人工点了多少次确认”衡量协作，而看四个更有意义的指标：**决策转契约率**、**同类问题复发率**、**每篇可交付稿所需人工分钟数**，以及 **单次人工决策保护的后续运行数**。最后一个指标可以视为 Human Steering Leverage：它越高，越说明人类在教系统，而不是替系统打工。

公开版决策账本见 [`human-decision-ledger.json`](human-decision-ledger.json)。它只保存脱敏后的工程决策、编译产物和自动化边界，不保存对话原文或个人事实。

---

## 七、实验结果：从“偶尔写得好”到“可重复交付”

### 6.1 七日机械交付与内容质量

| 指标 | 旧状态/基线 | 候选结果 | 解读 |
|---|---:|---:|---|
| 七日机械交付 | 2/7（28.57%） | 7/7 | 长流程可靠性明显提升 |
| 内容均分 | 94.42 | 97.15 | 候选平均提升 2.73 分 |
| 按日胜负 | — | 5 胜 2 负 | 不是每天都优于基线，因此仍保留回滚 |
| 硬门禁 | — | 7/7 | 候选均通过基本事实与结构门 |
| 运行时干预 | 0 | 23 | 流程漂移被显式看见 |
| 成功恢复 | 0 | 14 | Harness 不只是监控，确实恢复任务 |
| Codex 整稿救援 | — | 1 天 | 国产模型为主，SOTA 只点石成金 |

七日平均 API 成本约 **$0.0397/天**，中位耗时约 **10.7 分钟**，最长约 **18.7 分钟**。对 Daily Log 来说，质量优先于秒级延迟，这个量级可接受；但恢复次数和长尾耗时仍需要在线观察。

### 6.2 七月离线回填

- 31 天冻结输入全部生成合格影子 Reader：**31/31**；
- 语义审阅完成：**31/31**；
- 终止失败：**0**；
- 所有运行保持 `canonicalWriteAllowed=false`，即先验证、不覆盖线上稿。

### 6.3 七月新旧稿同日配对

目前严格可比的同日样本只有 4 天，不能冒充整月结论：

| 日期 | HomeMac 新稿 | VPS 旧稿 | 差值 | 结论 |
|---|---:|---:|---:|---|
| 07-02 | 96.25 | 75.63 | +20.63 | advance |
| 07-07 | 99.38 | 91.88 | +7.50 | advance |
| 07-10 | 99.38 | 86.88 | +12.50 | revise：存在一处商户/餐饮绑定风险 |
| 07-13 | 98.44 | 82.50 | +15.94 | advance |

四日平均 **98.36 对 84.22**，平均提升 **14.14**，4/4 胜出。这说明新链路在“内容完整、主线和可读性”上有明显潜力；07-10 的 revise 也说明高分不等于可以无条件发布，typed evidence binding 仍然必要。

### 6.4 最新 V230 收敛状态

- 冻结七日回归 7/7，无 terminal failure 或 degraded；
- 独立内容评估 7/7 advance，五个维度均不低于 4/5；
- 人工复核 3 篇：1 篇直接保留，2 篇小改后保留；
- 2026-09-02 隔离真实日期完成 11 个阶段，来源与语义审计通过，包含 27 张图片；
- 33 项聚焦回归通过；后续实现回执扩大到 39 项聚焦测试通过。

GPT-5.6 Sol xhigh 与 Fable 5.1 Max 的独立意见一致：**可以注册为本机 Progressive Shadow，但不能直接晋级 Stable 或生产发布**。

---

## 八、那些看似合理、实际无效的做法

### 1. 用固定 64 条解决上下文过长

失败原因：不同日期的信息密度差异巨大；局部投影让事实台把“没看到”误判为“没有”。

替代方案：动态预算 + 来源类别覆盖 + 全量目录 + 按需补读 + absence 门禁。

### 2. 再加一个 Agent 解决上一个 Agent 的问题

失败原因：handoff 增加随机点，每一层都会压缩上下文并重新判断重要性。

替代方案：只在任务可独立、结果可验收、失败可单独重试时引入子 Agent；否则缩短链路。

### 3. 用正则判断叙事是否自然

失败原因：技术词、正常推测和机械话术在字符串层面相似，误杀率高。

替代方案：正则只检查哈希、结构、字段等机械约束；语义交给独立审稿模型。

### 4. 只看综合分数

失败原因：五分制在 95 分以上出现饱和，同一评估器自身也会波动；高分可能掩盖一个具体硬伤。

替代方案：A/A 噪声基线、配对偏好、硬错误清单、人工“是否值得留下”四层共同判断。

### 5. 直接用作者总结替换其他证据

失败原因：作者总结很重要但不会覆盖所有事件，替换会造成新的遗漏。

替代方案：作者总结做 priority sidecar；事实集合仍由跨源事件簇组成。

### 6. 内容达到 96 分仍不允许交稿

失败原因：把“发布”和“绝对正确”混为一谈，最终门禁越堆越严，系统无法产出。

替代方案：区分硬错误与可修订表达。基本事实可靠、可读性达标即可进入 Shadow；疑点进入 revise，不因小问题把整篇归零。

---

## 九、与前沿方法的对应关系

这套系统不是照搬某个框架，而是把几类成熟思想组合成适合个人叙事的工程结构：

1. **AgentSpec**：把 Trigger、Check、Enforce 插入 Agent 运行循环。我们采用其运行时约束语义，但没有强依赖 DSL。
2. **Chain-of-Evidence**：每个重要 claim 既要有证据链，证据也必须真正支持该 claim；不能在成稿后再补一层装饰性引用。
3. **W3C PROV**：来源、派生产物和执行活动应被显式建模，使删除、回放和审计都能沿血缘进行。
4. **FactBank 的来源相对事实性**：同一句话由谁说、对事实持什么立场，是判断事实状态的重要组成，不能只看文本表面。
5. **软件工程中的状态机、契约与变异测试**：阶段可计算、结束条件可执行，并用故意破坏某个门禁的方式证明该门禁确有价值。
6. **Microsoft Human-AI Interaction Guidelines**：局部纠错、长期学习、谨慎适配、反馈后果可见和全局控制是不同控制面，不能把一次改稿误当成系统偏好。
7. **DAgger**：专家在当前策略实际遇到的状态上给纠正，再把新样本聚合进训练/评测集；这与“冻结真实 bad case，而不是空想更多规则”同构。
8. **InstructGPT / 人类偏好对齐**：更大模型不自动等于更符合人的真实意图；个人系统必须保存 owner-specific preference，而非只追逐通用评分。
9. **Generative Agents**：完整经历记录、较高层反思和动态检索彼此互补；反思的重要性仍要由个人价值校准，不能由出现频次独断。

外部方法提供设计语言，真正决定是否采用的仍是本地冻结样本、跨日回归和人工反馈。

---

## 十、现在处于什么状态

截至 2026-09-04：

- **Stable**：仍是冻结的 `stable-v11-approved-20260809`，没有被本轮实验改写；
- **生产 Progressive**：仍由既有 V135 路径承担；
- **新候选 V230**：已注册为本机 Progressive Shadow，等待首个合格来源并完成 7 个自然日验证；
- **七月/八月 VPS canonical Markdown**：只读核验均为 31/31；
- **Notion 回填**：不能声称完成。七月只有 26 条成功且带 URL 的回执，八月只有 4 条，仍需单独补证；
- **生产写入**：本轮实验为 0，未覆盖 canonical、Notion 或 VPS 正文。
- **人工决策编译**：高价值遗漏已能进入哈希绑定的正文义务，并在最终交付面重复验收；9 月 4 日真实重跑中拦截过一次下游语义回归。

七日在线门禁要求：

1. 七个不同真实日期都生成 Reader；
2. 每天最多一次有界重试；
3. 零硬事实冲突、零主线或核心生活遗漏；
4. 零未授权外部写入；
5. 人类按异常优先审阅，并随机抽两篇；
6. 不允许整日丢稿。

---

## 十一、可复用的十条工程原则

1. **先冻结一个可接受版本，再创新。** 没有保底线，任何优化都可能演化成不可逆退化。
2. **Prompt 不是状态数据库。** 计划、进度、证据和完成条件必须持久化。
3. **“没检索到”不等于“不存在”。** absence claim 必须绑定完整来源覆盖证明。
4. **结构正确和内容优秀是两套门。** 代码验结构，模型验语义，人验价值。
5. **人审异常，不审表格。** 高置信建议默认载入草稿，人只修改例外。
6. **先做 A/A，再相信 A/B。** 不知道评估噪声，就不知道提升是否真实。
7. **子 Agent 必须可验收。** 不能定义输入、输出和完成谓词的任务，不值得拆。
8. **恢复必须有界。** 重试、章节修补和 SOTA 救援都要有预算和适用前置条件。
9. **让作者信号决定重要性，不决定全部事实。** 主观叙事与客观校正应互补。
10. **达到停止条件就停止微调。** 进入真实流量观察，比继续修离线小样本更有价值。

---

## 结语

两周工作的真正成果不是某一篇 98 分的日记，也不是搭建了多少个 Agent，而是逐步回答了一个更一般的问题：

> 如何把一个概率生成系统，改造成可以每天交付、失败可解释、结果可回放、改坏能回滚的工程系统？

答案不是压制模型的创造力，也不是把一切都改成确定性代码，而是建立清晰分层：**事实底盘稳定、运行过程有状态、恢复边界明确、叙事上层开放、评估独立、晋级谨慎。**

DeepSeek 负责大部分生产写作，SOTA 模型只在关键失败和方案复核中点石成金；Harness 保证任务按流程完成，独立审稿保证内容值得留下，Stable/Progressive/Frontier 三轨则保证创新不会破坏每日交付。

而人类的角色也因此更清楚：不是逐句替 Agent 写稿，而是在关键时刻提供机器最难自己产生的训练信号，校准价值、发布边界和全局方向；系统再把这些判断编译为可复用契约，让同类问题不必重复人工纠正。

这套系统尚未结束。下一步不是继续扩大编辑室，而是完成七天真实运行，让“离线能写好”变成“每天都能稳定写好”。

---

## 参考资料

- AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents: https://arxiv.org/abs/2503.18666
- Google Research, Science One Framework / Chain-of-Evidence: https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence/
- W3C PROV-O: https://www.w3.org/TR/prov-o/
- FactBank 1.0: https://catalog.ldc.upenn.edu/LDC2009T23
- Guidelines for Human-AI Interaction: https://doi.org/10.1145/3290605.3300233
- DAgger / A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning: https://proceedings.mlr.press/v15/ross11a.html
- Training language models to follow instructions with human feedback: https://arxiv.org/abs/2203.02155
- Generative Agents: Interactive Simulacra of Human Behavior: https://arxiv.org/abs/2304.03442

## 内部证据索引

- `daily-dialogue-v2/artifacts/v129-progressive-admission-20260826/summary.json`
- `daily-dialogue-v2/artifacts/v136-progressive-admission-20260827/decision.md`
- `daily-dialogue-v2/artifacts/v164-fable5-root-cause-review-20260829/fable5-review.md`
- `daily-dialogue-v2/artifacts/v242-fable51-paired-ab-editorial-density-review-20260902/`
- `daily-dialogue-v2/artifacts/v245-fable51-author-sidecar-review-20260902/`
- `daily-dialogue-v2/artifacts/v260-dual-model-convergence-review-20260903/decision.md`
- `daily-dialogue-v2/artifacts/v261-v230-local-progressive-shadow-approval-20260903/implementation-receipt.json`
- `personal-data/daily-dialogue/evaluations/july-2026-homemac-vs-vps-20260830/report/summary.json`
- `personal-data/daily-dialogue/evaluations/v233-july-stable-shadow-backfill-20260902-v1/`
