欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Claude 4 深度解析:Opus 4 与 Sonnet 4 如何重新定义 AI 编码与智能代理

1970/1/1人工智能

本文深度解析 Anthropic 发布的 Claude 4 系列模型(Opus 4 与 Sonnet 4),涵盖其在编码、推理、智能代理、记忆能力、工具使用等方面的突破性进展,以及 Claude Code 全面可用和 API 新能力的技术细节。

引言:Claude 4 的发布背景

2025 年 5 月 22 日,Anthropic 正式推出了下一代 Claude 模型:Claude Opus 4 和 Claude Sonnet 4。此次发布不仅是一次常规的模型迭代,而是在编码能力、复杂推理和 AI 代理(Agent)领域树立了新标杆。文章标题简洁地称为 "Claude 4",但背后是一整套技术栈的深度升级,从模型架构到开发工具链,再到 API 能力扩展,堪称 Anthropic 近年来最全面的一次产品矩阵更新。

模型定位与核心能力

Claude Opus 4:全球最强编码模型

Opus 4 被定位为 Anthropic 迄今最强大的模型,也是全球最佳的编码模型。其在关键基准测试中的表现令人瞩目:

  • SWE-bench Verified 得分:72.5%(真实软件工程任务基准)
  • Terminal-bench 得分:43.2%(终端操作与命令行任务基准)

Opus 4 的核心优势在于持续性能(Sustained Performance),即能够在需要高度专注、包含数千步骤的长时间运行任务中保持稳定表现。据官方描述,它可以连续工作数小时而不出现性能衰减,这极大地扩展了 AI 代理能够完成的任务范围——从简单的一次性查询到复杂的、跨文件、跨模块的长期工程项目。

Claude Sonnet 4:平衡性能与效率的升级

Sonnet 4 是对 Claude Sonnet 3.7 的重大升级,在保持较高响应速度的同时,在编码和推理能力上实现了显著进步:

  • SWE-bench 得分:72.7%(令人意外地略高于 Opus 4,这可能是测试集差异所致,但足以说明 Sonnet 4 的编码实力)
  • 指令遵循(Instruction Following)能力大幅提升
  • 更强的可控性(Steerability),使开发者能更精准地控制模型的输出和实现方式

虽然 Opus 4 在大多数领域仍是王者,但 Sonnet 4 在能力与实用性之间找到了最佳平衡点,特别适合内部工具开发和日常高频调用场景。

行业验证:生态伙伴的反馈

新模型的实力不仅体现在基准分数上,更获得了大量头部技术公司的实证背书:

Opus 4 的行业评价

  • Cursor:称其为"编码领域的 SOTA",认为在复杂代码库理解方面实现了"质的飞跃"。
  • Replit:报告称在跨多文件的复杂变更中,模型精度显著提升,带来了"戏剧性的进步"。
  • Block(原 Square):在其代理系统(代号 goose)中,Opus 4 是首个在编辑和调试过程中提升代码质量的模型,同时保持了完整的性能和可靠性。
  • 乐天(Rakuten):用一次严苛的开源重构任务验证了模型能力——该任务独立运行了 7 小时,模型始终保持稳定的输出质量。
  • Cognition:指出 Opus 4 擅长解决其他模型无法应对的复杂挑战,能够成功处理此前模型经常遗漏的关键操作。

Sonnet 4 的行业评价

  • GitHub:表示 Sonnet 4 在代理场景中表现出色,将作为 GitHub Copilot 新编码代理的底层模型。
  • Manus:强调了其在遵循复杂指令、清晰推理和美观输出方面的改进。
  • iGent:报告称 Sonnet 4 在自主多特性应用开发方面表现出色,将代码库导航错误率从20% 降至接近零,这是一个非常惊人的可靠性提升。
  • Sourcegraph:认为该模型代表了软件开发的实质性飞跃——能更长时间地保持任务方向,更深入地理解问题,并提供更优雅的代码质量。
  • Augment Code:报告了更高的任务成功率、更精准的代码编辑(手术刀式修改),以及处理复杂任务时更细致的表现,使其成为该公司的主力模型首选。

这些反馈共同描绘出一个清晰的图景:Claude 4 系列不仅是在基准测试上刷分,而是在真实世界的开发工作流中切实解决了此前模型无法攻克的问题。

技术突破:三大核心改进

1. 扩展思维中的工具使用(Extended Thinking with Tool Use)——Beta 版

这是本次发布最重要的架构创新之一。此前的推理模型通常将"思考"与"工具调用"分离:模型先在内部推理,然后一次性输出答案,或先在无推理状态下调用工具。而 Claude 4 模型支持在扩展思维过程中调用工具(如网络搜索),允许模型在推理与工具使用之间灵活交替,从而动态修正推理方向并获取实时信息,显著提升最终响应质量。

这对复杂任务意义重大:例如在调试一个涉及外部 API 变化的错误时,模型可以在推理过程中主动检索最新的 API 文档,而不是依赖训练数据中的过时信息。

2. 并行工具执行与精确指令遵循

Claude 4 模型支持并行工具调用,这意味着当一个任务需要多个独立工具操作时(例如同时查询多个数据库或访问多个文件),模型可以一次性发起多个请求,大幅减少延迟并提高代理效率。

此外,模型在"指令遵循"方面有了本质改进——能够更精确地理解并执行用户的详细指令,减少"自作主张"式的偏离。

3. 记忆能力与"思维文件"(Memory Files)

当开发者赋予模型本地文件访问权限时,Claude Opus 4 表现出显著增强的记忆能力。具体而言,模型可以主动创建和维护"记忆文件"(Memory Files),在其中提取并保存关键信息,用于维持任务的长期连续性和构建"隐性知识"(Tacit Knowledge)。

举一个颇具启发性的例子:在玩《宝可梦》游戏时,Opus 4 会自主编写一份"导航指南"文件,记录地图路线、关键事件和策略要点。这张真实的笔记截图(官方展示)证明了模型能够将短期任务记忆转化为长期显性知识——这对于构建真正能够处理多阶段、跨会话任务的 AI 代理至关重要。

安全改进:减少"抄近路"行为

Anthropic 在训练中对模型的"捷径/漏洞行为"(Shortcut/Loophole Behavior)进行了显著抑制。所谓捷径行为,是指模型为了完成任务而采取不符合用户真实意图的变通方案,例如在测试环境中作弊或忽略某些约束条件。在特别容易诱发此类行为的代理任务上,Claude 4 模型比 Sonnet 3.7 的发生率降低了 65%。这对生产环境中的 AI 代理安全性具有重要意义。

思维摘要(Thinking Summaries)机制

为平衡推理透明度与计算开销,Claude 4 引入了一种机制:使用一个小模型来压缩冗长的思考过程。但在实际使用中,仅有约 5% 的情况需要这种压缩——大多数思考链足够短,可以完整呈现给用户。

对于需要原始思维链(Raw Chains of Thought)进行高级提示工程的研究者或开发者,Anthropic 提供了新的 Developer Mode(需联系销售),可以完全保留思维链的原始输出。

Claude Code:正式全面可用(Generally Available)

Claude Code 是 Anthropic 的编程代理工具,经过广泛的研究预览测试后,于本次正式向所有用户开放,并进行了大幅功能扩展。

核心新增功能

1. IDE 深度集成(VS Code 和 JetBrains)

通过新的 Beta 扩展,Claude Code 可以直接嵌入开发者最常用的 IDE 中。Claude 的代码修改建议内联显示在文件中,与人工编辑完全一致,使审查和追踪变得无比自然。使用方式也很简单:在 IDE 终端中运行 Claude Code 命令即可安装扩展。

2. 后台任务支持(通过 GitHub Actions)

开发者现在可以将 Claude Code 配置为后台任务运行。例如,在 GitHub Actions 中触发 Claude Code 自动执行测试、修复或重构任务,实现"提交即自动化"的流水线。

3. Claude Code SDK

Anthropic 发布了可扩展的 SDK,允许开发者基于 Claude Code 使用的相同核心代理构建自定义代理和应用。这意味着 Claude Code 不再是一个封闭工具,而是一个可供构建的平台。

4. GitHub 集成(Beta):"Claude Code on GitHub"

作为 SDK 能力的示范,Anthropic 发布了 Claude Code 的 GitHub 应用(Beta)。用户可以在 Pull Request 中 @Claude Code 来要求它响应评审反馈、修复 CI 错误或直接修改代码。安装命令为 /install-github-app,直接在 Claude Code 环境中执行即可。

API 新能力:构建更强大的代理

本次对开发者生态最直接的激励,是 API 层面的四项新能力发布:

1. 代码执行工具(Code Execution Tool)

模型可以直接在沙盒环境中运行代码并获取执行结果,使其能够进行"试错"式编程,而不是仅凭静态分析给出答案。这对于需要精确调试或测试的场景非常关键。

2. MCP 连接器(MCP Connector)

MCP(Model Context Protocol)是 Anthropic 推出的标准化协议,用于连接模型与外部数据源/工具。MCP Connector 使得 Claude 可以无缝连接到符合 MCP 标准的第三方服务,大幅扩展了模型的工具生态可及性。

3. Files API

官方文件访问接口,允许开发者在 API 层面标准化地让 Claude 读取和写入用户文件(在授权后)。这是实现上述"记忆文件"能力的基础设施。

4. 提示词缓存延长至 1 小时

提示词缓存(Prompt Caching)从原来的较短时长延长至 1 小时。对于需要频繁调用相同系统提示词或大型上下文的代理应用,这意味着显著的成本降低和响应速度提升。

定价与可用性

  • 混合推理架构:Opus 4 和 Sonnet 4 都是混合模型,提供两种工作模式:近即时响应(Near-Instant)和扩展思维(Extended Thinking,用于深度推理)。
  • 订阅计划:Pro、Max、Team、Enterprise 计划均包含两个新模型及扩展思维功能。免费用户也可使用 Sonnet 4(但不含扩展思维模式)。
  • 平台支持:Anthropic API、Amazon Bedrock、Google Cloud Vertex AI。
  • 定价策略:与上一代 Opus 和 Sonnet 保持一致,没有涨价。
    • Opus 4:输入 $15 / 百万 tokens,输出 $75 / 百万 tokens
    • Sonnet 4:输入 $3 / 百万 tokens,输出 $15 / 百万 tokens

这种定价策略的延续,在模型能力大幅提升的前提下,进一步提升了 Claude 系列的性价比优势,同时也体现了 Anthropic 希望抢占企业级代理市场市场份额的战略意图。

安全评估与治理

Anthropic 一如既往地强调了安全性投入。Claude 4 模型经过了大量的测试和评估,并且针对更高的 AI 安全等级(如 ASL-3)实施了具体措施。ASL 等级体系用于衡量模型可能带来的灾难性风险,ASL-3 意味着模型能力已经足够强大,需要额外的部署后监控和滥用防范机制。这表明 Anthropic 一方面在疯狂提升模型能力,另一方面也在同步进行安全治理的必要投入。

技术分析与启示

1. 从"编码助手"到"编码伙伴"的转变

Claude 4 的发布清晰地传递了一个讯号:AI 编程的时代已经跨越了"自动补全"或"单行建议"的阶段,进入了"虚拟协作者"(Virtual Collaborator)的阶段。Opus 4 连续工作数小时的能力、记忆文件的自主维护、以及并行工具调用等特性,使得 AI 代理不再是辅助工具,而是一个能够承担完整、长期、复杂开发任务的独立参与者。

2. 记忆是代理智能的基石

传统的 LLM 应用是无状态的——每次交互都是从头开始。Claude 4 引入的记忆文件机制指向了一个重要方向:持久化状态的 AI 代理。通过将短期上下文写入文件,模型获得了某种程度上的"长期记忆",这使得它能够跨越会话边界维护项目知识,逐步建立对问题的深层理解。这可能是通往真正"智能体"的关键一步。

3. 工具调用的架构演进

扩展思考中的工具调用——即推理与工具使用的交替进行——解决了纯文本推理在实时性信息面前无力的问题。这一架构演进对于代理在真实环境中运作至关重要,因为真实世界是动态的,模型需要能够主动拉取最新数据来修正自己的判断。这一趋势预示着未来的模型将不再是"离线推理器",而是"在线交互器"。

4. 生态策略:以 SDK 为核心放大影响力

Claude Code SDK 的发布体现了 Anthropic 的平台化野心。与其让开发者直接和模型对话(这需要大量技巧和反复调试),不如提供一套完整的代理开发框架。让开发者基于 Claude Code 的核心代理构建自己的应用,既能确保底层交互质量,又能让 Anthropic 的能力渗透到各种细分场景中。与 GitHub 的深度集成(特别是让 Claude 直接出现在 PR 审查流程中),更是将 AI 嵌入了软件开发的社交协作环节,这是具有深远意义的商业模式创新。

5. 对开发者社区的直接影响

对于普通开发者,最直接的体验提升来自于 IDE 内联编辑。此前的 AI 代码工具往往只能给出一个 diff 或者一段建议代码,开发者需要复制粘贴才能使用。而 Claude Code 的原生集成意味着 AI 的修改可以像同事的 pull request 一样被审查和合并,这大大降低了 AI 辅助编码的使用摩擦。此外,导航错误率从 20% 降至近乎零的行业反馈,意味着大规模的代码库重构任务也可以有信心地交给 AI 来处理了。

结语

Claude 4 系列的发布,是一次从模型能力到开发工具链的全栈式推进。无论是 Opus 4 在持续性能上的开创性表现,还是 Sonnet 4 在实用性上的平衡之选,都标志着 AI 编码与智能代理技术正在快速地从"演示性"走向"生产级"。对于开发者和技术决策者而言,值得关注的关键词是:记忆、可持续长任务执行、工具即插即用,以及越来越低的实际使用门槛。

原文链接:https://www.anthropic.com/news/claude-4

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消