欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Claude Opus 4.8 深度解析:更诚实、更高效的 AI 协作新纪元

1970/1/1人工智能

本文深度解析 Anthropic 发布的 Claude Opus 4.8,聚焦其性能提升、诚实性改进、动态工作流等新特性,并基于早期测试者反馈展现其在真实场景中的突破性表现。

引言

2026 年 5 月 28 日,Anthropic 正式发布 Claude Opus 4.8——这是对 Opus 4.7 的一次全面升级。新模型在多项基准测试中表现更优,且保持原价不变。更重要的是,Claude Opus 4.8 不是一个孤立的产品更新,它伴随着一系列新功能的推出:用户现在可以控制 Claude 在任务上投入的“努力程度”,Claude Code 新增“动态工作流”功能以处理超大规模问题,而 Opus 4.8 的“快速模式”速度达到 2.5 倍,且成本比前代降低了三倍。

性能基准全面领先

Anthropic 在官方公告中公布了 Opus 4.8 与前代及其他模型的对比数据,覆盖编码、智能体能力、推理及实际知识工作任务等多个维度。由于完整基准在 System Card 中披露,这里我们提炼几个关键亮点:

  • Super-Agent 基准:Opus 4.8 是唯一一个端到端完成所有案例的模型,不仅超越前代 Opus,还在同等成本下击败了 GPT-5.5。这标志着它在复杂多步骤任务中的可靠性达到了新的水平。
  • CursorBench:在每个努力等级下,Opus 4.8 都超越了之前的 Opus 模型。工具调用效率显著提升,用更少的步骤达成同样的智能水平,并能完整执行端到端任务。
  • Legal Agent Benchmark:Opus 4.8 得分创下新高,并成为第一个在“全通过”标准下突破 10% 总分的模型。这对法律领域意味着实质性的准确率提升,直接决定了客户能放心将多少真实律师工作委托给 AI。
  • Online-Mind2Web:在计算机使用和浏览器智能体测试中,Opus 4.8 达到 84% 的得分,远超 Opus 4.7 和 GPT-5.5。它展现出更强的反射性和任务保持能力,这对于企业级智能体的端到端可靠性至关重要。

这些数据表明,Opus 4.8 不仅是一个增量更新,而是在多个关键维度上实现了质的飞跃。

协作体验:早期测试者说“更可靠、更敏锐”

公告中采录了大量早期测试者的直接评价,这些反馈比任何基准数字都更能说明问题:

  • 判断力提升:在 Claude Code 中,Opus 4.8 会提出正确的问题,能自己捕捉错误,当计划不合理时会提出反对,在大规模改动前会通过复杂的多服务探索来建立信心。一位测试者称:“这是一个非常适合构建的模型。”
  • 多领域广泛验证:在翻译、深度研究、幻灯片制作、分析等智能体产品中,它都提供了强大的可靠性。法律科技公司 CoCounsel 表示,相比前代,Opus 4.8 在一致性和推理质量上有显著提升。
  • 质量与风格的平衡:另一位测试者强调,Opus 4.8 是“语音、品味和技术执行需要并行的场景中最值得信任的模型”,它在长会话中能更好地保持上下文和风格方向。
  • 独立自主运行:用于 Devin 的工程师团队指出,Opus 4.8 的工具使用干净,指令遵循一致性好,能够满足无人值守的自主工程工作负载需求。他们还特别提到,Opus 4.8 修复了 Opus 4.7 在注释冗长和工具调用方面的问题。
  • 分析质量更高:长期评估显示,Opus 4.8 的分析质量持续高于前代,且速度更快、输出更丰富、信息密度更高。一个突出特点是它倾向主动标记输入输出中的问题,而其他模型往往忽略这些问题,留待用户自己发现。

财务文档处理公司 Hebbia 发现,Opus 4.8 在引用精度和 token 效率上比 4.7 有明显改进,对高频处理密集备案文件的客户非常友好。

诚实性:核心改进之一

大多数 AI 模型的一个通病是急于下结论,即使证据不足也会自信地宣称取得进展。Anthropic 声称他们训练模型保持诚实——避免做出无法支撑的主张。而 Opus 4.8 在这方面实现了长足进步:早期测试者报告它更倾向于主动标识自己工作中的不确定性,较少做出无支撑的断言。

官方评估显示,Opus 4.8 允许其编写的代码中存在缺陷却未加指出的概率,比前代低了约四倍。这一特性对于实际编程场景极为重要,因为它减少了开发者的审查负担,增强了信任感。

Anthropic 的 Alignment 团队在发布前进行了详尽的评估,结论是 Opus 4.8 在亲社会特质上达到新高,例如支持用户自主权和以用户最大利益行动。而在不良行为(如欺骗或与滥用合作)的发生率上,Opus 4.8 显著低于 Opus 4.7,与其最佳对齐模型 Claude Mythos Preview 相当。这些完整评估和安全测试记录在 Claude Opus 4.8 System Card 中。

同步推出的新功能

除了新模型,Anthropic 还推出了三项重要更新:

动态工作流(Dynamic Workflows)

这是本次发布的亮点之一。该功能处于研究预览阶段,允许 Claude 在 Claude Code 中接管更大规模的任务。Claude 可以规划工作,然后在单次会话中运行数百个并行的子代理(配合 Opus 4.8,这些子代理可以运行更长时间)。它执行完毕后会先验证输出,再向用户汇报。

一个实际案例:Opus 4.8 现在可以从启动到合并,完成横跨数十万行代码的仓储级迁移,以其现有测试套件作为衡量标准。这大大扩展了 AI 在真实软件工程中的可用性。动态工作流目前适用于 Claude Code 企业版、团队版和 Max 计划。

claude.ai 和 Cowork 中的努力控制(Effort Control)

用户现在可以在模型选择器旁看到一个“努力程度”控件,以调节 Claude 在响应上花费的精力。更高努力等级意味着 Claude 更频繁、更深入地思考,从而提供更高质量的回答;较低努力等级则响应更快,且消耗用户速率限制更慢。这一选择对所有计划开放,给予了用户更大的灵活度。

Messages API 更新

Messages API 现在允许在 messages 数组中直接包含 system 条目。开发者可以在任务中途更新 Claude 的指令,而无需破坏提示缓存,也不必通过用户回合来传递更新。这对于在智能体运行时动态调整权限、token 预算或环境上下文非常有用。

关于努力等级的技术说明

Opus 4.8 默认设置为“高努力”(high effort),Anthropic 认为这是质量与用户体验的最佳折中。在编码任务上,此设置消耗的 token 数大致与 Opus 4.7 默认设置相当,但性能更好。用户可选择“额外”(extra,在 Claude Code 中为 xhigh)或“最大”(max),模型会投入更多 token 以换取更出色的结果。官方建议在困难任务或长时间运行的异步工作流中使用“extra”等级。

值得注意的是,快速模式价格的大幅下降(约为基础成本的 1/3)使得开发者能以更低成本使用 Opus 4.8 的高效版本,这可能会改变某些成本敏感型应用的经济模型。

行业影响与展望

从早期测试者的反馈来看,Opus 4.8 已是目前最强的智能体模型之一,尤其在法律、编码和复杂工作流领域。Databricks 的智能体 Genie 使用 Opus 4.8 后,在代理式推理能力上实现了阶跃式提升,且其多模态能力让 Genie 可以直接处理 PDF、图表等非结构化内容,token 成本比 Opus 4.7 低了 61%——这是一个非常显著的效率提升。

总体而言,Opus 4.8 的发布不仅仅是模型能力的提升,更代表着 AI 从工具向可信赖协作伙伴的演进。其诚实性增强和动态工作流等特性解决了当前 AI 在实际部署中最关键的痛点——可靠性与自主性。随着这些能力的成熟,AI 将能承担起更大范围的专业任务,推动企业级应用的边界不断拓展。

原文链接

Anthropic 官方公告:Introducing Claude Opus 4.8

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消