TOT思维树

854 字
4 分钟
TOT思维树

论文核心内容提炼:Tree of Thoughts: Deliberate Problem Solving with Large Language Models#

作者:Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan (Princeton University & Google DeepMind)

发表:NeurIPS 2023 (Oral)


1. 研究问题#

  • 标准语言模型推理(包括 CoT 和 Self-Consistency)本质是线性、从左到右的 token 生成,难以探索、前瞻与回溯。
  • 本文引入“系统2”式规划,让模型在树状问题空间中搜索,而不是只走一条直线。

2. 核心方法:思维树(Tree of Thoughts, ToT)#

将问题建模为搜索树,每个节点是输入与中间思维序列组成的状态;每个思维是比 token 更大的连贯语言片段。通过 BFS 或 DFS 探索多条路径,并在每一步进行 LM 自我评估。

四个关键设计维度#

维度说明示例
思维分解定义适中的思维粒度一行方程、计划段落、一个单词
思维生成生成下一步候选独立采样或 propose prompt
状态评估评价当前状态独立打分或投票
搜索算法探索树的策略BFS 保留 top-b,DFS 可回溯

3. 三组实验与结果#

3.1 24点游戏#

IO 7.3%,CoT 4.0%,CoT-SC 9.0%, ToT(b=5)74%。60% 的 CoT 错误发生在第一步,ToT 通过并行探索和评估避免早期错误。

3.2 创意写作#

人类评估中 41% 偏好 ToT、21% 偏好 CoT;GPT-4 自动评分 ToT 7.56 > CoT 6.93 > IO 6.19。

3.3 5×5 迷你填字游戏#

IO 单词准确率 14%,CoT 15.6%, ToT 60%,解出 4/20 个完整游戏。DFS 可在后续线索无法满足时回溯换词。

4. 与其他方法的对比#

方法探索多路径前瞻/回溯自我评估适用复杂规划任务
IO / CoT
CoT-SC
ToT

5. 优点与局限性#

优点#

  • IO、CoT、CoT-SC 都可视为 ToT 的特例。
  • 思维生成、评估、搜索算法可模块化替换。
  • 无需训练,且每一步思维和评估结果可读。

局限性#

  • 计算开销大,token 消耗可能高出 CoT 5~100 倍。
  • 依赖强大的基础模型,GPT-3.5 在 24 点上仅 19%。
  • 每个任务都需要人工设计思维粒度、prompt、评估方式和搜索策略。

6. 核心贡献总结#

  • 将经典 AI 搜索与大语言模型融合,提出通用 ToT 框架。
  • 在 24 点、创意写作、迷你填字等复杂任务上显著提升,24 点从 4% 提升至 74%。
  • 使用 LLM 自身作为状态评估器,替代传统启发式函数。
  • 为编程、机器人、数据分析等需要规划、探索和回溯的场景铺路。

原论文在线预览#

ToT 原论文第 1 页 ToT 原论文第 2 页 ToT 原论文第 3 页 ToT 原论文第 4 页 ToT 原论文第 5 页 ToT 原论文第 6 页 ToT 原论文第 7 页 ToT 原论文第 8 页 ToT 原论文第 9 页 ToT 原论文第 10 页 ToT 原论文第 11 页 ToT 原论文第 12 页 ToT 原论文第 13 页 ToT 原论文第 14 页

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

TOT思维树
https://www.shanfengpm.com/posts/2026-03-11-paper-tree-of-thoughts/
作者
山风
发布于
2026-03-11
许可协议
CC BY-NC-SA 4.0
本文首发于「山风blog」,作者:山风(余涛)。欢迎转发、分享本文链接, 但禁止任何形式的未授权转载、摘编、改写或商业使用
推荐文章论文阅读
Profile Image of the Author
山风
12年产品经验,持续记录产品思考、业务设计、数据分析和团队管理实践。
站点统计