欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Claude Opus 5 深度解析:半价逼近前沿智能的日常化模型

1970/1/1人工智能

Claude Opus 5 以一半成本接近 Claude Fable 5 的前沿智能,在编码与知识工作基准上创下新 SOTA,成为日常使用的默认模型。

引言:Opus 系列的新定位

2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5。这次发布不同于以往简单的性能迭代——它明确将 Opus 系列从"最强但昂贵"的定位转向"日常生活默认工作horse"。核心策略是:在保持 Opus 4.8 同等成本的前提下大幅提升性能,同时以接近旗舰模型 Fable 5 的智能水平、一半的价格切入市场。它是 Claude Max 计划的默认模型,也是 Claude Pro 上最强的可用模型。

这一策略背后反映了 AI 厂商对市场需求的深刻洞察:多数用户需要的不是极限智能,而是可靠、可负担、可日常依赖的智能。Opus 5 正是为此而生。

性能与成本效益:一张图看懂 Effort 设置

Anthropic 在发布材料中特别强调了一个设计维度——effort setting(努力程度设置)。用户可主动调节模型投入的推理计算量,以在"更高智能"与"更低 token 消耗/更快速度"之间做权衡。文档中的图表展示了随着 effort 从低到高(low → high → xhigh → max),模型在各类基准上的性能曲线。

编码基准:全面领先

在 Frontier-Bench v0.1(Anthropic 内部高难度软件工程真实任务基准)上,Opus 5 超过所有竞品,其低 effort 输出就超过 Opus 4.8 的两倍多,且单任务成本更低。

在 CursorBench 3.2(针对 AI 编程助手 Cursor 场景的基准)上,Opus 5 在 max effort 下与 Fable 5 的峰值差距仅 0.5%,但单任务成本只有后者一半。更重要的是,在所有 effort 档位(high、xhigh、max),同一成本下 Opus 5 的得分都高于其他模型。

其他编码相关结果:

  • AA Coding Agent Index(专门衡量 agentic coding 能力的指数)中,Opus 5 同样登顶。
  • 早期客户在 Devin 平台上反馈:Opus 5 在困难调试和根因分析任务上表现格外突出。
  • 在 FrontierCode 1.1 上,Opus 5 以一半成本达到接近 Fable 的水平。

知识工作与抽象推理:拉开代差

ARC-AGI 3:要求模型解决从未见过的新颖问题(抽象推理极限测试)。Opus 5 的得分是次优模型的 3 倍。这是目前公认最能拉开模型代差的基准之一。

Zapier AutomationBench(衡量模型从头到尾完成企业业务任务,如数据整理、客户通知、报告汇总):Opus 5 在相同的单任务成本下,通过率约为次优模型的 1.5 倍。即便在最低 effort 档,它通过的测试也超过所有其他模型的任意档位。

OSWorld 2.0(计算机使用基准,考核模型操作 GUI 完成真实任务):Opus 5 在任意给定成本下超越所有模型,且仅在 Fable 5 最佳成绩三分之一的成本下就刷新了纪录。

其他 Opus 5 登顶且成本最优的评估还包括:HLE(人类最后考试)、AutomationBench、DeepSearchQA、GDPval-AA v2(GDP 估值任务)等。

科学研究能力:生命科学全面跃升

Opus 5 相比 Opus 4.8 在科学研究上是实质性进步——在 Anthropic 覆盖结构生物学、有机化学、生物信息学的所有生命科学内部基准上均表现更优。

最显著的提升在:

  • 有机化学:从光谱数据推断分子结构(内部基准得分比 Opus 4.8 高 10.2 个百分点)
  • 蛋白质相关任务:预测序列变体对蛋白功能的影响(得分高 7.7 个百分点)

一位早期客户(从事基因组学分析)如此评价:"Claude Opus 5 的行为比我们跑过的任何模型都更像一位严谨的科学家——它会主动选择合适的统计检验来排除混杂变量,用独立方法交叉验证自己的结果,并在漫长的多步分析中不偏离轨道。"

主动性与彻底性:自我验证的 Agent

Opus 5 最大的行为变化在于验证工作并迭代直到成功的能力。Anthropic 在评估和早期测试中记录了大量案例,这里摘录几个最具代表性的:

案例一:为自己写视觉管线的机械制图重建

在 Frontier-Bench 的一个任务中,模型拿到一张机器零件图纸,被要求写代码重建为一个 3D FreeCAD 模型。但测试设计者故意不给模型任何直接查看图纸的途径。Opus 5 的应对方式是:自己编写一套完整的计算机视觉管线,直接从原始像素中提取几何信息,然后重建整个零件。它能反复成功;相同设置下的竞争模型尝试五次均未能解决。

案例二:修复社区未发现的边界情况

面对一个流行开源包管理器中的真实 bug,Opus 5 不仅找到根因,还修复了社区补丁所遗漏的边界情况。作为对比,某竞争模型只修复了表面症状(而非根本原因),并报告称 bug 已解决。

案例三:单会话构建完整市场数据管道

一位交易公司的工程师让 Opus 5 为一个新交易所构建市场数据馈送系统。前代模型即便在工程师提供详细规划的情况下也完全无法完成。由于找不到现成的数据流来验证,Opus 5 竟然自行构建了一个测试框架,来验证其代码能正确解析交易所的数据。

案例四:周末担任"幕僚长"接管开发环境

一位客户反馈:"整个周末我让 Opus 5 担任开发环境的幕僚长——它自己构建监控器,驱动每台机器,只在需要人为判断时才叫我介入。"

客户实战反馈精选

Anthropic 公布了多个早期客户的详细反馈,以下是关键信息的结构化提炼:

客户/场景 核心反馈
Zapier 测试 模型拿到一份未加工的健康度工作簿,端到端完成完整的流失预防流程:标记高风险账户、提醒负责人、汇总给留存运营。此前模型从未通过,Opus 5 通过率 100%
内部客户(agent 平台) 在自家最难 agentic 编码任务上比 Opus 4.7 提升 22%,且逐次运行方差显著降低——一致性是大规模产品化关键
Lovable(数百万开发者平台) 称其为 Opus 家族自 4.5 以来最大飞跃,前端动画、游戏和 3D 作品是 Opus 系列见过最好的
金融研究客户 开放型分析工作上比 Opus 4.8 严格升级,"最难、最模糊的任务上增益最大",响应更清晰简洁,高 effort 下效率也更高
财务建模客户 比 Opus 4.8 准确率平均高 9 个百分点,且少用三分之一的 turn/工具调用,时间节省 60%,"性能下限高得多"
Box 企业级评估 Opus 5 比 Opus 4.8 综合高出 8%,数据分析工作流提升 11%,尽职调查工作流提升 17%
前端开发评价 能像真实前端工程师一样检查自己的工作,在浏览器中打开页面验证

一位客户总结道:"Opus 5 在大规模代码库(如基础研究助手代码库)上完成我们平时会拆成更小部分的改动,在 agentic 流程中还能根据反馈持续调整,推理解释比我们用过的任何模型都清晰。"

视觉输出能力:从气流到细胞结构

显式视觉能力并非本次发布重点,但 Opus 5 也确实展示出更强的视觉输出水准。Anthropic 给出两个互动示例:

  1. 风洞模拟:可视化空气流过空气动力学(及非空气动力学)物体的流动。官方推出可调设置的互动风洞工具。
  2. 细胞结构互动图解:构建了简化的细胞交互式插图,可探讨其内部元素。

横评总结与定位分析

若将 Opus 5 放入 Anthropic 产品光谱:

  • Mythos 5(可能为旗舰或安全特化模型)在网络安全任务上仍领先
  • Fable 5(前沿性能标杆)在极值分数上仍最高
  • Opus 5 则占据"前沿智能的性价比甜蜜点"——接近 Fable 的智能,一半的成本,Opus 级别的速度

对一个正在将 AI 从"演示工具"推进为"日常生产力伙伴"的产业而言,稳定性与收敛性往往比峰值性能更紧迫。多位客户不约而同地提到"一致性"(低方差)和"能处理更模糊、更开放的任务",这恰恰是 agentic AI 走向规模化所必需的品质。

在基准方面,值得注意 Opus 5 在 ARC-AGI 3 上获得3倍于次优模型的成绩——当模型开始能系统性解决"之前从未见过的问题类型"时,这正是通往更通用智能道路上一个值得记录的路标。

原文链接

https://www.anthropic.com/news/claude-opus-5

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消