欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

模型不是企业的护城河,那什么才是?

2026/7/6人工智能

最近跟几个做企业的朋友聊天,发现大家都有个共同的困惑:模型每个月都在变强,但自己的公司好像并没有跟着变强。这种感觉挺微妙的——明明给员工开了大模型账号,上了Copilot,接入了知识库,还搞了几个Agent试点,今年又开始折腾OpenClaw这类产品,让AI从“会说”变成“会干”。演示效果确实惊艳,发布会也足够热闹,员工写文档快了,会议纪要好生了,PPT和方案也能快速输出了。

但问题来了:这些使用痕迹有没有真正沉淀为企业能力?专家经验有没有变成组织资产?每一次任务完成后,下一次能不能做得更好?如果明天把底层模型换了,企业积累下来的判断还在不在?如果所有公司都把知识喂给少数几个大模型,最后的价值到底留在谁手里?

这些问题,才是企业AI进入深水区后真正的分水岭。


AI竞争的三个阶段

在我看来,AI竞争已经走过了两个阶段,正在进入第三个:

  • 第一阶段:模型能力之争。比谁的参数大,谁的理解能力强,谁的生成质量高。
  • 第二阶段:Agent应用之争。比谁能把模型包装成好用的工具,谁能做出更流畅的交互体验。
  • 第三阶段:智能资产之争。这才是接下来更关键的战场——谁能把AI变成企业自己的智能引擎,而不是仅仅当一个租户。

这个判断不是我瞎说的。在通用大模型热潮最汹涌的时候,衔远科技的创始人周伯文教授就提出了一个逆势判断:AI发展的正确路径,是在充分泛化的基础上,具备对任何领域深度专业化的能力。

说白了,通用模型解决的是“会做”的问题,但企业竞争力从来不来自“会做”,而来自“比别人做得更准确、更快、更符合自己的业务逻辑”。一家企业如果只是接入了最好的通用模型,相当于所有人都坐上了同一趟高铁——速度快了,但方向和目的地都一样,竞争优势无从建立。

这个判断比“企业需要AI工具”更深一层,也比“企业要建私有化部署”更准确。它指向的是一个根本问题:在AI时代,企业专业能力的所有权,归谁?


纳德拉的Token Capital概念,但有个漏洞

微软CEO纳德拉最近提出了一组很有意思的概念:Human Capital(人力资本)和Token Capital(词元资本)。他认为,企业通过AI系统沉淀下来的可复用智能能力,是这个时代新的资本形态。AI不会让人力资本变得不重要,反而会让真正高质量的人类判断更重要。

真正危险的,是企业把自己的知识、经验和判断全部交给外部模型,却没有形成自己的学习系统。他用全球化作类比:第一次全球化中,很多产业把制造能力外包出去,产业空心化的代价持续多年。AI时代,如果被外包的是认知能力和专家经验,后果可能更严重。

但纳德拉没有回答的问题是:企业的专业判断、业务规则和专家经验,如果是在使用通用模型的过程中被持续吸入模型底座,那Token Capital,究竟是在自己手里,还是在模型厂商手里?

周伯文教授的回答很明确:专业化能力必须留在企业自己的平台上、自己的know-how里,而不是成为通用模型无限膨胀的训练材料。 这不只是技术路线的选择,更是一种商业伦理的表态:企业把数据和经验交给一个平台,这个平台有没有责任让这些资产留在企业自己手里?

而回答这个问题,需要的不只是承诺,而是一套企业自己能验证的评测体系。


真实企业任务,比公开Benchmark难得多

就在这个背景下,衔远科技大观研究院团队发布了一篇论文:EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions。这篇论文一出来就登上了Hugging Face Daily Papers日榜第二名,意味着全球研究社区当天认为这是最值得关注的论文之一。

更重要的是,衔远同步开放了评测协议和构造方法。这意味着任何企业、研究团队都可以用同样的方法,在自己的数据上构建私有评测集。

这个EnterpriseClawBench跟传统的benchmark完全不是一回事。它不是用传统问答题测试模型,也不是让模型在标准化题库里刷分,而是从真实企业工作会话中构建Agent评测任务。

具体怎么做的?衔远科技Frontis团队从真实工作场景中,抽取了2026年3月到5月的内部Agent使用记录,经过过滤、分类、评分标准生成等一系列自动化处理,最终构建出852个可复现任务,并人工审计出120个Lite任务子集。

这些任务覆盖了产品、研发、HR、行政、销售、市场、财务、运营、管理层等真实岗位。任务形态完全来源于企业日常工作:

  • 有人上传会议录音和项目群进展,让Agent写日报
  • 有人上传Excel,让Agent校准收入、成本、毛利和现金流
  • 有人上传PDF和模板,让Agent生成案例展示
  • 有人要求生成HTML页面、PPT、表格、报告、代码或图片
  • 还有人让Agent分析周报、修改OKR、整理客户拜访计划、生成解决方案

这跟传统问答benchmark完全是两个世界。传统评测经常考的是模型能不能答对。而EnterpriseClawBench考的是:Agent能不能在企业工作空间里,读取异构文件、恢复上下文、调用工具、生成可用交付物,并且在成本、耗时、格式、视觉质量和证据准确性上都过关。

这就像把AI从“考试环境”拉进了“真实办公室”。


评测设计的几个关键点

在构造方式上,EnterpriseClawBench做了几层关键设计:

第一,来自真实工作会话,而不是人工想象出来的任务。 这一点太重要了。很多benchmark的问题都是研究者坐在办公室里想出来的,跟实际业务差十万八千里。而这里的数据来自真实的员工-Agent交互记录,每个任务都是真实发生过的工作需求。

第二,同时评估文本和视觉交付物。 不只看回答内容,也看文件是否真的可用。比如你让Agent生成一个PPT,它不仅要内容正确,还要PPT能正常打开、格式规范、视觉上可用。

第三,采用硬规则和语义评分结合的方式。 文件类型对不对、文件数量够不够、文件是否为空、能不能打开——这些是硬规则,不满足直接扣分。准确性、相关性、深度、实用性、表达质量——这些是语义评分,需要模型或人工来评估。

第四,把成本和耗时也纳入报告。 企业部署AI不可能只看效果,不看ROI。如果一个Agent效果很好但每次调用要花10块钱、跑5分钟,那在实际业务中可能根本用不起。

第五,由于源数据包含企业内部内容,不释放数据本身,而是开放构造与评测协议。 这一点非常关键,因为它恰好回答了纳德拉提出但没有解决的问题:企业需要评测系统,但不能为了评测牺牲自己的内部数据和知识资产。


三个反直觉的结论

回到EnterpriseClawBench本身,它最值得关注的不是榜单排名,而是揭示出的三个反直觉事实。

第一个事实:真实企业任务远未被Agent解决

在人工审计的120个Lite任务上,最强组合Codex/GPT-5.5的得分也只有0.663。注意,这已经是当前最强的模型组合了,但得分还不到0.7。

这不是说模型不强,而是说明真实企业任务比公开benchmark难得多。企业任务往往不是单点问题,而是复合问题:要读文件,要理解上下文,要遵守格式,要生成交付物,要保留证据,要满足业务目标,还要能被人直接使用。任何一个环节出错,业务结果都可能不可用。

我举个例子:让Agent写一份周报,看起来很简单对吧?但实际任务可能是这样的——你上传了一个小时的会议录音、三天的项目群聊天记录、一份Excel数据表,要求Agent生成一份格式规范的周报,包含本周进展、下周计划、风险点、数据对比,还要附上关键决策的原文引用。任何一个环节出错,这份周报就没法直接用。

这就是0.663这个数字背后的现实。

第二个事实:Harness和模型一样重要

论文发现,同一个Claude模型,在不同Agent框架下表现差异很大。有的组合可以保持0.62到0.64的区间,有的框架下却掉到0.458。

这说明Agent不是模型的简单外壳。工具调用、权限控制、运行环境、文件写入路径、多步修复能力、执行链路长度——这些都会影响最终交付。

所以企业不能只问“你用了哪个模型”。更应该问:你的Agent如何执行?如何读文件?如何调用工具?如何生成交付物?如何保存证据?如何失败重试?如何被评估和优化?

这就像买车,不能只看发动机参数,还要看变速箱、底盘调校、悬挂系统、轮胎、电子辅助系统——所有这些加在一起才决定了一辆车的实际表现。

第三个事实:Skill注入是AI for AI的雏形,但必须被评测

EnterpriseClawBench做了一个很有意思的实验:从同类任务中蒸馏Skill,再注入Agent,测试它在留出任务上的表现。

结果发现,好的Skill确实可以提升Agent表现,但效果高度依赖“谁来生成Skill”和“哪个Agent来消费Skill”。有些Skill带来正迁移,有些Skill反而造成负迁移。

这非常重要。它恰恰说明“让Agent自我进化”在今天远不是自动成立的——放任沉淀经验,很可能让Agent变笨。正因如此,进化必须被评测约束。经验要进入系统,必须经过评估。Skill要进入生产,必须经过验证。Agent要自我进化,必须有一套能判断进化方向是否正确的私有化评测体系。


真正的模型能力评测不能只看外部榜单

这三个发现,共同指向同一个缺口:企业真正需要的,不只是model eval(模型评估),而是private eval(私有化评估)。

什么叫一次好的销售机会诊断?什么叫一个可被复用的专家判断?什么叫Agent真的改善了业务结果,而不是只生成了一份看起来漂亮的文档?

这些问题,通用模型公司无法替每家企业回答。答案藏在企业自己的业务目标、组织经验、隐性规则和管理判断里。

外部benchmark告诉你模型的通用能力,private eval才能告诉你AI是否真的在你的业务里创造价值。

正如纳德拉所说的“控制权测试”:如果明天换掉底层模型,企业积累的专家经验还在不在?如果不在,买到的只是外部能力;如果还在,才算真正沉淀了自己的智能资产。

这也是衔远大观MA进化引擎背后的设计逻辑:不是让Agent自己随便变,而是让Agent在评估、反馈、归因、沉淀和再训练中受控进化。


衔远大观:自主进化的智能资产引擎平台

沿着这个逻辑,衔远科技Frontis正在做的衔远大观Frontis Horizon,可以被更准确地定义为:自主进化的企业级智能资产引擎平台。

它不是传统的Agent编排工具,不是通用Agent平台工具,也不是简单的企业级OpenClaw。它真正要解决的是企业AI的更底层问题:

  • 如何把通用模型能力,转化为企业自己的专业能力?
  • 如何把专家经验,沉淀成可复用的Skill和Agent?
  • 如何把工作流、业务规则、组织记忆和评测标准沉淀为企业自有知识产权?
  • 如何让企业在替换底层模型时,仍然保留自己的DNA、Memory和Process?
  • 如何让每一次使用,不只是完成任务,而是反哺下一次能力提升?

一句话:衔远大观要做的不是帮企业“使用AI”,而是帮企业拥有一套可持续进化的自有智能系统。

在衔远大观的架构里,这套系统分为三层:

第一层:ME(人的组织代理)

ME不是聊天机器人,也不是静态个人知识库,而是在企业语境中代表人持续推进工作的受治理代理。它理解人的目标、偏好、职责、权限、风险边界和历史上下文,可以帮助人过滤信息、生成判断、推进任务,并在关键节点请求确认。

ME的价值不是“像不像我”,而是“能不能代表我把工作推向前”。

举个例子,某客户的销售总监反馈,接入ME之后,他每周整理跟进计划的时间大幅压缩。但更重要的变化发生在三个月之后——他的ME已经积累了大量高质量销售判断案例,这些判断模式开始被复用于团队的新人培训。

ME不是概念。衔远已经把ME的核心能力产品化为Leadeep AI领衔者——一款面向职场人的AI录音与洞察产品。上述销售总监使用的,正是Leadeep AI领衔者,也就是ME能力的移动端产品化形态。

它做的事情,正是ME层设计的微缩版:记录人在真实工作场景中的判断和决策,提炼关键信息,在下一次同类场景中更快给出建议。618期间,Leadeep在社交媒体上引发自发传播,背后不是靠营销,而是因为很多用户第一次感受到“AI真的在帮我积累判断,而不只是帮我整理文字”。

第二层:WE(企业的硅基组织)

企业不是只有一个Agent,而是需要由多个角色化专家Agent组成的协同网络。

比如,在世界500强大宗商品贸易企业的大豆采购场景中:大宗市场分析专家、海运物流专家、合规风控专家以及财务成本专家等,组成供应链Agent专家团,协同完成大豆采购交易。结果是什么?降低交易风险的同时,将行业研究周期从天缩短到小时,物流规划周期从周缩短到天。

WE的关键不仅在于专家数量,更在于组织上下文。没有目标、权限、证据、接口、语义标准和治理边界,再多Agent只是噪声。有了组织上下文,一群Agent才能变成真正的硅基组织。

第三层:MA(组织级学习与控制系统)

没有MA,ME和WE只是一套执行系统。有了MA,组织才会在每一次执行中变得更聪明。

MA要记录行动、评估结果、追踪证据、分析偏差、沉淀经验、更新规则——把错误变成材料,把反馈变成训练信号,把一次次任务变成企业能力复利。

这也是从双环学习走向三环学习:不仅复盘动作对不对,也复盘策略对不对,还复盘组织结构、能力结构和流程规则是否应该被重构。

正如上述大豆采购Agent专家团案例,通过持续反馈和使用沉淀专家经验到Skill和Agent,从而构建私有化评估和持续进化的组织能力,大宗贸易企业得以更好地应对急剧变化的宏观形势和国际市场。


结语:AI原生能力的核心在于持续进化

行业里有一个常见误区:企业里有很多AI工具、很多Agent、很多自动化工作流,就算AI原生了。

但这仍是旧时代的理解方式——组织本体不变,只是多装了几个智能体;管理方式不变,只是流程跑得更快一点。

真正的AI原生,不是“原来的企业+AI工具”,而是企业本身开始被重新定义。

过去的数字化系统,大多解决的是记录问题:ERP记录交易,CRM记录客户,OA记录流程,BI展示指标。它们让企业变得更透明,但并没有改变一个底层事实:人仍然是唯一行动主体。

AI原生系统改变的正是这个前提。AI不再只是记录和展示,而是开始理解目标、调用工具、推进任务、生成交付、接收评价,并在反馈中持续学习。企业系统正在从System of Record走向System of Learning。从“记录企业”走向“进化企业”。

回到文章开头的问题:模型不是企业的护城河,那什么才是?

答案已经清晰:私有化评估 + 可持续进化能力。

私有化评估,让企业能判断AI是否真的在自己的业务里创造价值,而不是只看外部榜单选模型。可持续进化能力,让每一次任务执行、每一次专家反馈、每一次经营复盘,都能转化为可复用的知识、Skill和Agent。

同一个大模型,所有人都可以买。同一种Agent框架,所有企业都能接。但每家企业在长期经营中形成的客户理解、专家判断、流程细节和决策偏好,不会自动存在于通用模型里。

如果企业不能把这些东西沉淀下来,AI用得越多,越可能只是替外部模型训练了世界,而没有训练自己的组织。

当底层模型明天被换掉,企业积累的DNA、Memory和Process还在——那才是真正意义上的Token Capital,也才是这个时代企业真正的护城河。


相关链接:

  • 衔远官网:https://frontis.cn/
  • 产品链接:https://ai.frontis.cn/
  • 论文链接:https://huggingface.co/papers/2606.23654
  • 代码链接:https://github.com/FrontisAI/EnterpriseClawBench
编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消