欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

大模型的智能与成本:被忽视的帕累托前沿真相

1970/1/1人工智能

文章揭示了AI模型智能指标与真实成本之间的巨大鸿沟,指出官方API定价与本地运行的电力成本差异悬殊,呼吁用更准确的成本视角重新评估模型性价比。

本文翻译并深度改编自Guido Imperiale(OpenTeams软件工程师,Dask维护者)的博客文章《LLMs: Intelligence vs. cost》,原文发表于2026年9月1日,探讨了大语言模型(LLM)的智能水平与使用成本之间的关系,并批评了现有基准展示方式的误导性。


1. 引子:智能与成本的矛盾

在LLM快速迭代的今天,我们常常被各种排行榜和基准测试(benchmark)淹没。但一个核心问题始终存在:你需要多聪明的模型?你愿意为这份聪明付出多少代价? 一个能解决复杂数学证明的超级模型,如果用来写一封简单的请假邮件,那不仅是浪费,更是烧钱。

ArtificialAnalysis(以下简称AA)是一个专注于LLM基准测试的网站。他们发布了一个综合性的“智能指数”(Intelligence Index),该指数通过对每个模型运行一组精选基准测试并取平均值计算得出。虽然这并非完美,但“总体上能反映模型的聪明程度”。AA还记录了另一项关键数据:运行这些基准测试的成本。由于所有模型测试的是同一批任务,这个成本数据就为用户提供了各模型相对使用成本的参考。

AA最核心的可视化图表是“智能 vs. 成本”图,图中展示了帕累托前沿(Pareto frontier)——即达到每个智能分数的最低成本模型。这个前沿至关重要,因为它提醒你:杀鸡焉用牛刀?用超级智能且昂贵的模型去做琐碎任务,绝对是金钱的浪费。

然而,作为一位长期关注该图的工程师,作者Guido对这幅图产生了越来越多的不满,原因有三。

2. AA图表的三个“原罪”

2.1 对数坐标造成的幻觉

首先,AA的图表对成本轴采用了对数刻度。采用对数刻度唯一的好处是,能让你用肉眼分辨0.015美元与0.032美元两个低价模型之间的差异,但同时图上还有一个成本高达3.69美元的模型,是前者的近250倍。然而,代价是:对数刻度让观众彻底无法直观感受到便宜模型与昂贵模型之间天壤之别的价格鸿沟,也让他们意识不到便宜模型之间那点价差是多么微不足道。

用线性刻度看,3.69美元到0.015美元是一条从左侧弹到右侧的弧线,差距一目了然;但用对数刻度,这些点被压缩在一段正常的区间里,仿佛它们只是“稍贵”和“稍便宜”的区别。

2.2 僵化的官方定价

其次,AA采用的是模型开发商官方API的定价。这在多数情况是公平的,但对于开源权重(open-weights)模型来说,情况就不同了:从第三方API提供商处租赁同一个开源模型,成本往往比官方API便宜得多。像OpenRouter这样的聚合平台可以让你轻松切换提供商,你总能找到那个最低报价。如果无视这个“底层市场”,你看到的成本就是虚高的。

2.3 被驱逐的本地模型

最后,也是最关键的问题:那些能够运行在消费级硬件(如个人电脑)上的本地模型,与数据中心里的模型有着天壤之别,但在AA图上,它们却被非常不公正地以数据中心托管的价格展示。这意味着一个可以塞进你游戏PC里的模型,却被标上了按小时租用GPU的价格——这完全不符合实际情况,因为没有任何一个理智的用户会为了一个轻量模型去租用数据中心。这种处理方式彻底扭曲了本地模型的经济价值。

3. 作者的自制图表

为了拨开迷雾,作者决定自己动手绘图。他使用了AA提供的智能指数和成本数据,并做了如下调整:

  • 智能指数:均来自AA,模型在最大思考努力(max thinking effort)下评测,除非特别说明。
  • 成本数据:大部分来自AA,但下文会详述对特定模型和类别的修正。

3.1 全览图与局部放大

首先,他绘制了一张截至2026年9月1日的顶级模型性能-成本图(图1)。读图时有两点提示:

  • 智能指数在1分以内的差距,普通人几乎感觉不到;5分的差距则比较明显。
  • 图中最低的智能分数50,其实已经相当于2026年2月时世界上最强模型(Opus 4.6)的水平!

左下角的绿色区域是“极廉价区”——这里聚集了大量便宜的模型。然后他放大该区域,将纵轴继续下探,一直到智能手机都能运行的模型。在图中,有些模型标注了 ⚡符号,代表该模型的成本是本地运行所需的电费(计算细节见后文),因为这种模型小到数据中心根本没必要为它提供服务。对比本地模型时,这个电费代价也就反映出了完成任务的耗时差异。

3.2 合并两图:看清收益递减

把两张图合并到一起,能直观地看到性能/成本的边际收益递减规律。绿色区域依然标注在两个图的公共区域。

4. 作者与AA图表的差异解析

作者明确列出了自己的图与AA图的四个关键不同点:

  1. 横轴改为线性刻度:因为钱不应对数化,一个普通用户在乎的是绝对的美元和美分,而不是相对倍数。
  2. 部分模型采用第三方最低价:Kimi K3、Qwen3.8 Max、DeepSeek V4 Flash 0731、GLM-5.3、GLM-5.3-Flash以及Hy3,其在OpenRouter上可获得的真实价格被替换了原始官方报价(剔除了奇慢无比、不可靠或没有零数据保留政策的服务商)。
  3. 对GLM-5.3-Flash高思考模式进行了外推:作者结合AA在高努力度下的得分以及Z.ai在不同努力度下的编码得分,交叉推算出估算点。
  4. 低于350亿参数(sub-35B)的模型,成本统一改为本地运行成本(详见下文)。
  5. 额外加入了Ornith-1.5-35B-A3B:该模型的智能分数是作者依据模型作者自报的基准结果推测的,可能带乐观偏差,阅读请谨慎。

5. 本地模型成本计算:电费才是真相

对于标有⚡的本地模型,其成本计算如下(简单粗糙的估算):

  1. 获取每次任务输出token数:从artificialanalysis.ai获取。
  2. 测量本地解码速度:单位为每秒token数(tok/s)。大多数测试在同一台2020年的NVIDIA RTX 3090显卡上进行(二手价格约1,400美元,现在算相对平价)。
  3. 测量功耗差:测量硬件在满载与空闲状态下的功率差。
  4. 电价设定:0.2049美元/kWh,这是2026年5月美国人口加权的居民平均电价。
  5. 附加15%的修正:为未缓存的输入token和等待工具调用的时间留出余量。
  6. 忽略硬件成本:作者认为RTX 3090 PC或64GB版本Strix Halo(一款迷你PC)本就是游戏或工作用的理想机器,不专为AI购置,所以硬件花费不算在成本中。

有趣的是,作者指出,在不同硬件平台上,电费差异并不显著:Strix Halo功率较低(能耗小),但速度较慢(运行时间长)——两者最终的总能耗近似。

6. 大型本地模型:硬件的隐形门槛

当你想本地运行超过64GB RAM才能承载的大模型时,忽略硬件成本就站不住脚了——毕竟,如果不是为了AI,很少有人需要128GB甚至更多的内存。作者列出了一些尴尬的现实:

  • 性价比出众的64GB Strix Halo售价约2,000美元,可以用来自在本地运行小模型,非常值。
  • 128GB Strix Halo售价约3,600美元,但除了运行约120B参数的模型外,你几乎不需要这么多内存做其他事。

因此,以下模型虽能本地运行,但会带来巨大的前期硬件投入:

内存配置 硬件举例(价格) 能原生运行的模型
128 GB Strix Halo $3,600;DGX Spark $4,300;Mac Studio M5 Max $5,100;MacBook Pro M5 Max $7,150 Qwen3.8-Flash;GLM-5.3-Flash(智能下降);DeepSeek-V4-Flash(智能下降)
256 GB 2x DGX Spark $8,700;Mac Studio M5 Ultra $11,300 GLM-5.3-Flash;DeepSeek-V4-Flash
512 GB 2x Mac Studio M5 Ultra $22,600 GLM-5.3
2 TB 2x TensTorrent Galaxy Blackhole $320,000 Kimi K3

7. 结论:智能的通货膨胀与钱包的抉择

作者最后总结道,当前市场上,来自Anthropic和OpenAI的顶级模型与价格低廉的中国模型之间存在巨大鸿沟:前者贵到连大型企业都觉得肉疼,后者则便宜得像手机话费套餐。

然而,用钱买来的额外智能,遵循着收益递减规律:顶尖工程师或科学家可能能体会Fable 5.1(智能66,每任务花费$3.69)比GLM-5.3(智能60,每任务$0.49,便宜7.5倍)好在哪里,但绝大多数普通人无法感知其中那6点的智能差异。

继续下探,GLM-5.3-Flash高努力模式(智能55,每任务$0.023——比Fable便宜160倍),在面对超复杂任务(如独立完成整个编程项目)时确实力不从心,但它足以满足人们90%的日常需求——即便是那些资深工程师和科学家,日常也未必用得上顶级智能。

再往下一档,一个游戏发烧友用自己本来就有的电脑,就能以每任务0.015美元电费运行Qwen3.8-27B(智能52)——同样的任务,Fable收费是它的246倍。

当智能与成本的曲线越来越陡峭,我们每个人,无论是个体开发者还是企业CTO,都需要冷静地审视:你真的需要那额外1分或5分的智能吗? 也许最好的模型,不是分数最高的那个,而是最合适的那个。


原文链接:https://openteams.com/intelligence-vs-cost/

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消