“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
Claude Opus 4.6 深度解析:更强编码、百万上下文与自适应思考
Anthropic 发布 Claude Opus 4.6:编码能力增强、支持 1M token 上下文,并在多项 Agentic 与专业任务评测中刷新 SOTA。
一、核心升级概览
2026 年 2 月 5 日,Anthropic 正式推出其最强模型 Claude Opus 4.6,作为 Opus 4.5 的继任者。本次升级聚焦于以下几个关键维度:
- 编码能力全面增强:规划更细致、能持续执行更长的 Agentic 任务、在更大规模代码库中操作更可靠,且代码审查与调试能力显著提升,能主动捕捉自身错误。
- 首次引入百万级上下文窗口(Beta):这也是 Opus 系列模型首次支持 1M token 上下文,极大拓展了处理长文档、大型代码库和复杂研究任务的能力边界。
- 提升日常知识工作能力:可胜任财务分析、研究、以及文档/电子表格/演示文稿的创建与使用。在 Cowork(Anthropic 的自主多任务功能)中,模型能整合这些技能代表用户自主工作。
- 引入多项新功能:包括 Claude Code 中的 Agent 团队机制、API 中的上下文压缩(Compaction)、自适应思考(Adaptive Thinking)以及精细化的努力程度控制(Effort Controls)。
- 办公套件深度集成:Excel 功能大幅升级,PowerPoint 功能以研究预览形式发布。
二、评测数据:各项基准登顶
Opus 4.6 在多个权威评测中取得了业界最高分,展现了全面的领先性:
| 评测基准 | 领域 | 亮点 |
|---|---|---|
| Terminal-Bench 2.0 | Agentic 编码 | 业界最高分 |
| Humanity's Last Exam | 多学科复杂推理 | 领先所有前沿模型 |
| GDPval-AA | 金融、法律等经济价值知识工作 | 超越 OpenAI GPT-5.2 约 144 Elo 分;超越前代 Opus 4.5 约 190 Elo 分 |
| BrowseComp | 硬核信息定位 | 能力超越所有其他模型 |
关于 GDPval-AA 的解释:该基准专门设计用于评估模型在金融、法律等具有实际经济价值的知识工作上的表现,Elo 分差直接反映了模型在复杂工作流中的相对效能差距。
安全评估:Anthropic 在随附的系统卡(System Card)中表示,Opus 4.6 的整体安全画像与业界任何前沿模型持平或更好,在各项安全评测中表现出的错误对齐行为(Misaligned Behavior)发生率极低。
三、产品功能创新
3.1 Claude Code:Agent 团队协作
Opus 4.6 支持在 Claude Code 中组建 Agent 团队(Agent Teams),多个 Agent 可并行协作完成复杂任务。例如,一个 Agent 负责代码库探索,另一个 Agent 负责测试编写,再有一个 Agent 进行代码审查,最后由主控 Agent 汇总结果。这种团队模式大幅提升了大型任务的执行效率。
3.2 上下文压缩(Compaction)
API 用户现在可利用 Compaction 功能让模型对自身上下文进行摘要压缩,从而在不触及上下文窗口上限的情况下执行更长序列的任务。这对于处理超长文档链或持续多轮的工具调用特别有用。
3.3 自适应思考(Adaptive Thinking)与努力控制
- 自适应思考:模型能根据上下文中的微妙线索(如任务复杂度和用户意图),自动调整是否使用扩展思维(Extended Thinking)的深度。对简单问题,它会减少内部推演以降低延迟;对复杂问题,它会自发加深推理。
- 努力控制(Effort Controls):开发人员现在可以通过
/effort参数手动调整模型的智能投入级别(默认为“高”),在速度、成本与回答质量之间取得最优平衡。Anthropic 建议:若发现模型过度思考,可将努力水平从 high 降至 medium。
3.4 办公套件:Excel 与 PowerPoint
- Excel 大幅升级:支持更复杂的公式操作、多表格数据整合、自然语言驱动的数据清洗与可视化。
- PowerPoint(研究预览):能生成结构清晰、设计精美的演示文稿,并支持用户基于主题快速创建原型。
四、模型可用性、定价与生态
Opus 4.6 即日起在 claude.ai、Anthropic API 以及所有主要云平台(如 AWS、Google Cloud 等)上线。开发人员可通过 claude-opus-4-6 模型标识符调用。
价格与上代保持一致:输入 5 美元 / 百万 token,输出 25 美元 / 百万 token。用户可参考官网定价页获取完整细节。
在 API 端,Anthropic 延续了其“用 Claude 构建 Claude”的工程文化——所有新模型都会在内部开发流程中接受真实代码任务的测试。据 Anthropic 工程师反馈,Opus 4.6 在实际使用中表现出三大特点:
- 自动关注高难度环节:无需显式提示,模型会自动将更多推理资源投入到任务中最棘手的部分,而在简单环节上保持高效。
- 更好的歧义处理:面对模糊的业务需求,模型能做出更明智的判断而非草率下结论。
- 长会话持久高效:在多轮交互中保持产出质量不滑坡。
五、真实世界反馈:企业级用户的实证
Anthropic 邀请了多家早期合作伙伴(Early Access Partners)对 Opus 4.6 进行测试,以下为他们的核心评价摘录及技术要点:
Notion(笔记/协作工具)
“Opus 4.6 是 Anthropic 迄今为止最强模型。它能将复杂请求拆解为具体步骤并真正执行到底,产出精致的工作成果。对 Notion 用户来说,它更像一位能力全面的协作者,而不仅是工具。”
Cognition(DevIn 的母公司,AI 编程辅助)
“在 Devin Review 中,Opus 4.6 显著提升了我们的缺陷捕获率。它能考虑其他模型忽略的边界情况,并给出更优雅、周密的解决方案。”
Cursor(AI 代码编辑器)
“Opus 4.6 极大地推进了 Agentic 规划。它能将复杂任务拆分为独立子任务,并行调用工具和子 Agent,并以极高精度识别出阻碍因素。这开启了长地平线任务(Long-Horizon Tasks)的新前沿。”
Sourcegraph(代码搜索/智能)
“它导航大型代码库并准确定位正确修改点的能力已达到业界最先进水平。能处理大量信息并保持一致性,为专家级系统提供了更强大的构建模块。”
Windsurf(AI 开发环境)
“相比 Opus 4.5,Opus 4.6 在需要精细探索的任务(如调试和理解陌生代码库)上体验明显更好。它思考时间更长,这在需要深度推理时非常值得。”
Harvey(法律 AI)
“Opus 4.6 在 BigLaw Bench 上取得 90.2% 的高分(所有 Claude 模型中最高),其中 40% 达到满分,84% 超过 0.8。这在法律推理领域表现出极高的可靠性。在 40 个网络安全调查案例中,Opus 4.6 在盲评中有 38 次表现优于 Claude 4.5 系列。”
GitLab(DevOps 平台)
“在一天之内,Opus 4.6 自主关闭了 13 个 issue,并将 12 个 issue 正确分配至团队成员,管理了包含约 50 人、横跨 6 个仓库的组织。它同时处理产品与组织决策,整合跨领域上下文,并知道何时该升级给人类处理——这是自主治理能力的重要里程碑。”
Lovable(无代码应用开发)
“Opus 4.6 在设计质量上有了显著提升。它能优雅地遵循我们的设计系统,且更加自主,这正是 Lovable 的核心价值观——人们应该专注于创造重要的东西,而不是微观管理 AI。”
Box(企业内容管理)
“在涉及法律、金融和技术内容的多源分析类高推理任务中,Opus 4.6 表现卓越。我们的评测显示其整体性能提升 10%(从 58% 基线升至 68%),在技术领域几乎达到满分。”
Figma(设计协作)
“Opus 4.6 在 Figma Make 中能生成复杂的交互式应用和原型,创意范围令人印象深刻。它能将详细设计和多层级任务一次性转化为代码,让团队能快速探索和构建。”
Replit(在线编码)
“Opus 4.6 是我们测试过的最好的 Anthropic 模型。它以极少的提示就能理解意图,甚至主动探索并创建了我自己都没想到的细节——感觉像是与模型协作,而不是等待它输出。”
六、技术细节深度展开
6.1 上下文窗口与长任务执行
1M token 上下文窗口(Beta)意味着模型可以一次性处理约数十万行代码、800 页左右的书籍、或数小时的视频(若有视觉输入)。但更大的上下文往往会带来位置偏置或“迷失在中间”的问题。Anthropic 表示通过改进注意力机制和训练策略,Opus 4.6 在长上下文中的信息保持和检索一致性有显著提升。实际测试中,它能在长达数小时的 agentic 任务中保持对早期状态的记忆,例如多仓库代码重构或大型文档审计。
6.2 Agentic 任务的设计哲学
Opus 4.6 在 Agentic 任务上的突破,来源于两个关键点:
- 规划能力增强:能自主将模糊目标分解为可执行的子任务,并依据优先级排列执行顺序。
- 错误纠正自愈:在执行过程中若发现假设错误,能主动回溯并调整策略,而不是盲目继续。这得益于其训练中强化了“自我批评”机制。
Anthropic 将其编码 Agent 的性能归功于“深度思考”(Extended Thinking)——模型在输出前会进行更长的内部推理链,并在得出结论前多次重新评估。这在复杂问题中尤为有效,但也可能增加简单任务的延迟,因此推出了努力控制来平衡。
6.3 与办公场景的深度融合
传统 LLM 在办公文档处理上常受限于格式化和交互性问题。Opus 4.6 针对 Excel 的优化包括:理解复杂公式逻辑、自动修复错误、跨工作表引用建议等。PowerPoint 功能则能根据用户提供的主题或大纲,自动生成包含合适版式、图片占位符和演讲备注的演示文稿。这两项功能的提升,实质上扩大了 LLM 在典型知识工作者日常工作流中的适用性。
6.4 安全性的系统策略
Anthropic 在系统卡中展示了多层次的安全评估,包括对抗性测试、越狱尝试、以及模型在需要拒绝协助不当请求时的合规性。Opus 4.6 在不同安全基准(如内部红队测试、外部伤害评估)上的错误对齐行为率均处于业界最低水平。此外,团队还强调了模型的“可引导性”(Steerability)——即能遵循不同企业的安全策略,而不出现偏好固化。
七、总结:意义与适用场景
Claude Opus 4.6 不仅仅是一次常规的模型迭代,它在 Agentic AI 领域树立了新的标杆,并证明了强推理、长上下文和自主协作能力可以同时存在于同一模型中。对于开发者、研究者和企业用户,这是一个值得立刻评估的工具:不要只把它当成 ChatGPT 的替代品,而应视为能够处理端到端工作流、与人协作做出决策的自动化助手。