# Translation and extraction notes

## 状态

- 输出模式：完整论文 reader。
- 来源格式：带可选文字层的双栏 PDF，共 13 页。
- 正文、方法、主要图注及扩展数据图表均已处理。
- 参考文献保留正文引文编号与原 PDF 页码，不对 33 条书目逐条翻译，避免破坏可检索字段。

## 术语决策

- `deep Q-network` 固定译为“深度 Q 网络”，首次使用后保留缩写 DQN。
- `experience replay` 固定译为“经验回放”；`replay memory` 译为“回放记忆”。
- `target network` 译为“目标网络”或在需区分时写作“目标 Q 网络”。
- `action-value function` 译为“动作价值函数”；`state value` 译为“状态价值”。
- `return` 译为“回报”，`reward` 译为“奖励”，两者不混用。
- `off-policy` 译为“离策略”，`ε-greedy` 译为“ε-贪心”。

## 提取与修复记录

- PDF 双栏交界处会把标题、作者行和跨页句子拆开；reader 根据页面视觉阅读顺序重新拼接。
- PDF 内嵌数学字体映射不完整，原始提取会把 `γ`、上下标和期望算子错误编码。`paper.md` 中的最优动作价值函数、DQN 损失、回报和贝尔曼方程依据页面公式重新排版为 LaTeX。
- p.4 图 4 图注与正文在双栏边界处重叠，已依据版面分离。
- p.7 目标网络段落及算法 1 的若干数学符号提取置信度为中等；文字含义和算法步骤已通过页面渲染核对，未猜测无法辨认的具体字形。
- 扩展数据表以高分辨率图像保留全部游戏名和数值；中文表注翻译列含义与实验条件，避免重新抄录数值造成转录错误。

## 图表裁切

- 共输出 6 张图和 4 张扩展数据表。
- 裁切排除了页眉、页脚与周围正文；图注在 Markdown 中作为独立双语文本呈现。
- 扩展数据表保留表下注释，因为这些注释是正确解释训练帧数和评估条件所必需的组成部分。

## 置信度

- 正文与方法自然语言：高。
- 依据页面重排的数学公式：高（语义与符号结构），但不保留出版社原始字形。
- p.7 PDF 字体编码严重错位区域：中；已在 reader 中采用语义等价的公式/算法表述。
