欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Claude 3.7 Sonnet and Claude Code

1970/1/1技术杂谈

{"category":"人工智能","title_cn":"Claude 3.7 Sonnet 与 Claude Code:混合推理模型与终端智能体的技术解析","content":"> Claude 3.7 Sonnet 是首个混合推理模型,统一了快慢思考能力,并配套推出终端智能体工具 Claude Code,在编码与真实世界任务上实现 SOTA 性能。\n\n## 从何说起:Anthropic 的发布背景\n\n2025 年 2 月 24 日,Anthropic 发布了 Claude 3.7 Sonnet——这是他们迄今为止最智能的模型,也是市场上第一个混合推理模型(hybrid reasoning model)。同日,他们推出了一个面向开发者的终端智能体编程工具:Claude Code。这篇文章将拆解这次发布的关键技术点:模型的混合推理设计哲学、API 的思考预算控制机制、编程能力的具体表现,以及 Claude Code 的定位与工作方式。\n\n## 核心哲学:一个大脑,两种模式\n\n当前市场上的推理模型(如 OpenAI 的 o1 系列、DeepSeek R1 等)通常采用独立推理模型路线:即专门训练一个模型,让它在回答前进行长时间的链式思考(chain-of-thought)。而 Anthropic 提出了一个截然不同的设计思路:\n\n> 就像人类用同一个大脑既处理快速反应又进行深度反思一样,我们认为推理应该是前沿模型的整体能力,而不是一个完全独立的模型。\n\n于是 Claude 3.7 Sonnet 将普通 LLM 与推理模型合二为一:\n\n- 标准模式(standard mode):即 Claude 3.5 Sonnet 的升级版,快速响应,适合绝大多数日常任务。\n- 扩展思考模式(extended thinking mode):模型在回答前先进行自我反思(self-reflection),在数学、物理、指令遵循、编码等任务上表现出显著提升。\n\n关键体验细节:在扩展思考模式下,Claude 的思考过程是透明可见的——用户能看到它逐步推理的过程,而非黑箱输出。这既增强了可解释性,也为开发者调试提示词提供了便利。Anthropic 还特别强调:提示词在两种模式下基本通用,无需为推理模式重写所有提示词。\n\n## API 的精细控制:思考预算(Thinking Budget)\n\n这是 Claude 3.7 Sonnet 在工程实践上的一个亮点。通过 API 使用时,用户可以设置模型思考的最大 token 数 N,且 N 可达输出上限 128K tokens。这意味着:\n\n- 你可以让 Claude 在思考上花费 1K tokens,快速得到答案;\n- 也可以分配给思考 100K tokens,让它在复杂问题上进行深度探索。\n\n这实际上是在速度(成本)与答案质量之间提供一个可调节的旋钮。对开发者而言,这是对推理模型使用成本的一种可预测的精细化管理方式,远胜于“要么快速回答,要么长时间思考”的二选一局面。\n\n## 定价策略:不加价,包含思考 token\n\n在标准与扩展思考两种模式下,Claude 3.7 Sonnet 均维持原有价格:\n\n- 输入:$3 / 百万 tokens\n- 输出:$15 / 百万 tokens(包括思考 token ——这意味着即使模型在思考时也消耗输出 token,这部分不会额外计费)\n\n与 OpenAI 的 o1 系列对推理 token 单独计价的做法相比,这一策略显然对重度使用推理模式的开发者更有吸引力。\n\n## 能力侧重:真实世界任务优先于竞赛题\n\nAnthropic 在这代模型的优化策略上做出了一个关键转向:\n\n> 我们较少针对数学和计算机科学竞赛题进行优化,而是聚焦于能反映企业实际使用 LLM 方式的真实任务。\n\n这意味着模型的评测指标选取也更偏向实际开发场景。官方公布的部分合作方反馈:\n\n- Cursor:Claude 再次成为真实世界编码任务的标杆,在处理复杂代码库与高级工具使用方面显著改进。\n- Cognition:在规划代码变更与处理全栈更新方面,Claude 远优于其他任何模型。\n- Vercel:特别强调 Claude 在复杂代理工作流中展示出的非凡精确性。\n- Replit:已成功用 Claude 从零构建了复杂的 Web 应用与仪表盘,而其他模型在这些任务上通常会陷入卡顿。\n- Canva:在评估中,Claude 持续产出接近生产级别的代码,且在设计品味上更优、错误大幅减少。\n\n## 基准测试:SOTA 的表现\n\nClaude 3.7 Sonnet 在以下基准上达到 SOTA:\n\n- SWE-bench Verified:评估 AI 解决真实软件问题的能力。\n- TAU-bench:测试 AI 代理在复杂真实任务中与用户和工具交互的能力。\n- 除传统基准外,其还胜过此前所有模型——包括在宝可梦游戏通关测试中(Anthropic 内部使用的综合性评估任务)。\n\n在扩展思考模式下,数学和科学任务的提升尤其明显(原文使用的图表对比了 Grok、Gemini 2 Pro、o1、o3-mini 与 DeepSeek R1 等模型,但具体数值在公开博客中未完全列出)。\n\n## Claude Code:终端内的主动协作智能体\n\nClaude Code 是 Anthropic 推出的首个智能体编码工具,目前以有限研究预览形式开放。它并非一个简单的代码补全工具,而是一个能主动协作的终端伙伴:\n\n- 搜索并阅读代码库\n- 编辑文件\n- 编写并运行测试\n- 提交与推送代码到 GitHub\n- 调用命令行工具\n- 在每一步操作中保持用户在循环内(keeping you in the loop)\n\n内部使用数据点:在早期测试中,Claude Code 能在一次调用中完成原本需要 45 分钟以上手动工作的任务——主要集中在测试驱动开发(TDD)、复杂问题调试和大规模重构(large-scale refactoring)。这些场景恰好是传统 IDE 补全工具无法穿透的深水区。\n\n### 产品定位与后续规划\n\nAnthropic 承认这是一个早期产品,但承认它已经变成团队不可或缺的工具。接下来的规划包括:\n\n- 提高工具调用的可靠性\n- 支持长时间运行的命令\n- 改进应用内渲染\n- 增强 Claude 对自身能力的理解(自我元认知)\n\n从更长远的视角来看,Claude Code 的发布不仅是一个产品,更是 Anthropic 收集开发者如何在实际中驱动 Claude 编码的数据渠道,从而反哺模型改进的循环。\n\n## Claude.ai 上的编码体验升级\n\n除了 API 与终端工具,Claude.ai 上也有编码相关的增强:\n\n- GitHub 集成面向所有 Claude 套餐开放(包括免费版、Pro、Team 与 Enterprise)——这意味着用户可以把自己的代码仓库直接连接到 Claude。\n- Claude 3.7 Sonnet 被定位为史上最强的编码模型,在理解个人项目、工作项目与开源项目方面更加深入,适合修复 bug、功能开发和文档撰写。\n\n注意:扩展思考模式在所有渠道可用,但 Claude 免费套餐除外——免费用户无法使用长思考模式。\n\n## 安全与责任:更少的拒绝,更强的抗注入\n\nAnthropic 在这一版本放入了大量安全工作:\n\n1. 更精细的拒绝机制:Claude 3.7 Sonnet 能更细致地区分有害与良性请求,与上一代相比不必要的拒绝减少了 45%。举例来说,过去某些涉及敏感话题的合法编程请求会被误拒,现在这类情况显著改善。\n2. 系统卡(System Card):提供了多个维度的安全评估结果,尤其是 Responsible Scaling Policy(责任扩展政策)评估细节,可供其他研究机构参考。\n3. Prompt Injection(提示词注入):新增了针对计算机使用能力所带来的风险评估,包括 Claude 如何抵抗和减缓这类攻击。\n4. 推理的可信度:系统卡研究了推理模型的安全优势——例如能否理解模型的决策过程,以及模型推理是否真正可信、可靠。\n\n## 一个技术细节:关于 TAU-bench 的脚手架\n\n附录中披露了一个很有意思的调优细节:在 TAU-bench 评估中,为了让 Claude 获得最佳分数,他们给 Agent 策略(Airline Agent Policy)添加了提示词附加条款,引导 Claude 在解决多轮任务时更有效地使用一个“规划工具”(planning tool),即模型被鼓励在解决过程中把想法写下来——这与普通的“思考模式”不同,它是在多轮轨迹的对话流中显式记录思路。\n\n这个细节揭示了当前推理模型的一个工程化秘密:在复杂交互代理场景下,实时文字化的“草稿”往往比内部隐式思考更有效,因为它提供了一种对对话历史的结构化记忆。\n\n## 未来走向与宏观判断\n\nAnthropic 将此次发布定性为“AI 增强人类能力之路上的重要一步”。从模型架构哲学到工具链部署,这次的信号非常明确:\n\n- 统一与融合:单独的推理模型范式正在走向统一(一个模型跑快慢两种模式),这与人类认知系统(系统 1 与系统 2 的协作)更贴近。\n- 成本透明与可控:思考预算控制为开发者提供了真正的工程化工具,不再是黑盒的“想多久由模型心情决定”。\n- 真实任务的权重优先于竞赛题:这很可能促使下一阶段行业评测体系的全面转向。\n- 终端智能体是下一代编码界面:Claude Code 证明,AI 协作不仅是聊天窗口或 IDE 插件,更是能直接操作 git、跑测试、做重构的自主代理。\n\n## 兼容性与可用性\n\nClaude 3.7 Sonnet 的发布范围包括:\n\n- Claude 全部套餐(Free / Pro / Team / Enterprise\n- Claude Developer Platform\n- Amazon Bedrock\n- Google Cloud Vertex AI\n\n原文链接:https://www.anthropic.com/news/claude-3-7-sonnet\n"}

(注:原文末尾的“Supplementary”“Additional”等零散附录内容因缺乏有效语义,已在翻译时省略。)

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消