“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
模型不是企业的护城河,那什么才是?
最近跟几个做企业的朋友聊天,发现大家都有个共同的困惑:模型每个月都在变强,但自己的公司好像并没有跟着变强。这种感觉挺微妙的——明明给员工开了大模型账号,上了Copilot,接入了知识库,还搞了几个Agent试点,今年又开始折腾OpenClaw这类产品,让AI从“会说”变成“会干”。演示效果确实惊艳,发布会也足够热闹,员工写文档快了,会议纪要好生了,PPT和方案也能快速输出了。
但问题来了:这些使用痕迹有没有真正沉淀为企业能力?专家经验有没有变成组织资产?每一次任务完成后,下一次能不能做得更好?如果明天把底层模型换了,企业积累下来的判断还在不在?如果所有公司都把知识喂给少数几个大模型,最后的价值到底留在谁手里?
这些问题,才是企业AI进入深水区后真正的分水岭。
AI竞争的三个阶段
在我看来,AI竞争已经走过了两个阶段,正在进入第三个:
- 第一阶段:模型能力之争。比谁的参数大,谁的理解能力强,谁的生成质量高。
- 第二阶段:Agent应用之争。比谁能把模型包装成好用的工具,谁能做出更流畅的交互体验。
- 第三阶段:智能资产之争。这才是接下来更关键的战场——谁能把AI变成企业自己的智能引擎,而不是仅仅当一个租户。
这个判断不是我瞎说的。在通用大模型热潮最汹涌的时候,衔远科技的创始人周伯文教授就提出了一个逆势判断:AI发展的正确路径,是在充分泛化的基础上,具备对任何领域深度专业化的能力。
说白了,通用模型解决的是“会做”的问题,但企业竞争力从来不来自“会做”,而来自“比别人做得更准确、更快、更符合自己的业务逻辑”。一家企业如果只是接入了最好的通用模型,相当于所有人都坐上了同一趟高铁——速度快了,但方向和目的地都一样,竞争优势无从建立。
这个判断比“企业需要AI工具”更深一层,也比“企业要建私有化部署”更准确。它指向的是一个根本问题:在AI时代,企业专业能力的所有权,归谁?
纳德拉的Token Capital概念,但有个漏洞
微软CEO纳德拉最近提出了一组很有意思的概念:Human Capital(人力资本)和Token Capital(词元资本)。他认为,企业通过AI系统沉淀下来的可复用智能能力,是这个时代新的资本形态。AI不会让人力资本变得不重要,反而会让真正高质量的人类判断更重要。
真正危险的,是企业把自己的知识、经验和判断全部交给外部模型,却没有形成自己的学习系统。他用全球化作类比:第一次全球化中,很多产业把制造能力外包出去,产业空心化的代价持续多年。AI时代,如果被外包的是认知能力和专家经验,后果可能更严重。
但纳德拉没有回答的问题是:企业的专业判断、业务规则和专家经验,如果是在使用通用模型的过程中被持续吸入模型底座,那Token Capital,究竟是在自己手里,还是在模型厂商手里?
周伯文教授的回答很明确:专业化能力必须留在企业自己的平台上、自己的know-how里,而不是成为通用模型无限膨胀的训练材料。 这不只是技术路线的选择,更是一种商业伦理的表态:企业把数据和经验交给一个平台,这个平台有没有责任让这些资产留在企业自己手里?
而回答这个问题,需要的不只是承诺,而是一套企业自己能验证的评测体系。
真实企业任务,比公开Benchmark难得多
就在这个背景下,衔远科技大观研究院团队发布了一篇论文:EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions。这篇论文一出来就登上了Hugging Face Daily Papers日榜第二名,意味着全球研究社区当天认为这是最值得关注的论文之一。
更重要的是,衔远同步开放了评测协议和构造方法。这意味着任何企业、研究团队都可以用同样的方法,在自己的数据上构建私有评测集。
这个EnterpriseClawBench跟传统的benchmark完全不是一回事。它不是用传统问答题测试模型,也不是让模型在标准化题库里刷分,而是从真实企业工作会话中构建Agent评测任务。
具体怎么做的?衔远科技Frontis团队从真实工作场景中,抽取了2026年3月到5月的内部Agent使用记录,经过过滤、分类、评分标准生成等一系列自动化处理,最终构建出852个可复现任务,并人工审计出120个Lite任务子集。
这些任务覆盖了产品、研发、HR、行政、销售、市场、财务、运营、管理层等真实岗位。任务形态完全来源于企业日常工作:
- 有人上传会议录音和项目群进展,让Agent写日报
- 有人上传Excel,让Agent校准收入、成本、毛利和现金流
- 有人上传PDF和模板,让Agent生成案例展示
- 有人要求生成HTML页面、PPT、表格、报告、代码或图片
- 还有人让Agent分析周报、修改OKR、整理客户拜访计划、生成解决方案
这跟传统问答benchmark完全是两个世界。传统评测经常考的是模型能不能答对。而EnterpriseClawBench考的是:Agent能不能在企业工作空间里,读取异构文件、恢复上下文、调用工具、生成可用交付物,并且在成本、耗时、格式、视觉质量和证据准确性上都过关。
这就像把AI从“考试环境”拉进了“真实办公室”。
评测设计的几个关键点
在构造方式上,EnterpriseClawBench做了几层关键设计:
第一,来自真实工作会话,而不是人工想象出来的任务。 这一点太重要了。很多benchmark的问题都是研究者坐在办公室里想出来的,跟实际业务差十万八千里。而这里的数据来自真实的员工-Agent交互记录,每个任务都是真实发生过的工作需求。
第二,同时评估文本和视觉交付物。 不只看回答内容,也看文件是否真的可用。比如你让Agent生成一个PPT,它不仅要内容正确,还要PPT能正常打开、格式规范、视觉上可用。
第三,采用硬规则和语义评分结合的方式。 文件类型对不对、文件数量够不够、文件是否为空、能不能打开——这些是硬规则,不满足直接扣分。准确性、相关性、深度、实用性、表达质量——这些是语义评分,需要模型或人工来评估。
第四,把成本和耗时也纳入报告。 企业部署AI不可能只看效果,不看ROI。如果一个Agent效果很好但每次调用要花10块钱、跑5分钟,那在实际业务中可能根本用不起。
第五,由于源数据包含企业内部内容,不释放数据本身,而是开放构造与评测协议。 这一点非常关键,因为它恰好回答了纳德拉提出但没有解决的问题:企业需要评测系统,但不能为了评测牺牲自己的内部数据和知识资产。
三个反直觉的结论
回到EnterpriseClawBench本身,它最值得关注的不是榜单排名,而是揭示出的三个反直觉事实。
第一个事实:真实企业任务远未被Agent解决
在人工审计的120个Lite任务上,最强组合Codex/GPT-5.5的得分也只有0.663。注意,这已经是当前最强的模型组合了,但得分还不到0.7。
这不是说模型不强,而是说明真实企业任务比公开benchmark难得多。企业任务往往不是单点问题,而是复合问题:要读文件,要理解上下文,要遵守格式,要生成交付物,要保留证据,要满足业务目标,还要能被人直接使用。任何一个环节出错,业务结果都可能不可用。
我举个例子:让Agent写一份周报,看起来很简单对吧?但实际任务可能是这样的——你上传了一个小时的会议录音、三天的项目群聊天记录、一份Excel数据表,要求Agent生成一份格式规范的周报,包含本周进展、下周计划、风险点、数据对比,还要附上关键决策的原文引用。任何一个环节出错,这份周报就没法直接用。
这就是0.663这个数字背后的现实。
第二个事实:Harness和模型一样重要
论文发现,同一个Claude模型,在不同Agent框架下表现差异很大。有的组合可以保持0.62到0.64的区间,有的框架下却掉到0.458。
这说明Agent不是模型的简单外壳。工具调用、权限控制、运行环境、文件写入路径、多步修复能力、执行链路长度——这些都会影响最终交付。
所以企业不能只问“你用了哪个模型”。更应该问:你的Agent如何执行?如何读文件?如何调用工具?如何生成交付物?如何保存证据?如何失败重试?如何被评估和优化?
这就像买车,不能只看发动机参数,还要看变速箱、底盘调校、悬挂系统、轮胎、电子辅助系统——所有这些加在一起才决定了一辆车的实际表现。
第三个事实:Skill注入是AI for AI的雏形,但必须被评测
EnterpriseClawBench做了一个很有意思的实验:从同类任务中蒸馏Skill,再注入Agent,测试它在留出任务上的表现。
结果发现,好的Skill确实可以提升Agent表现,但效果高度依赖“谁来生成Skill”和“哪个Agent来消费Skill”。有些Skill带来正迁移,有些Skill反而造成负迁移。
这非常重要。它恰恰说明“让Agent自我进化”在今天远不是自动成立的——放任沉淀经验,很可能让Agent变笨。正因如此,进化必须被评测约束。经验要进入系统,必须经过评估。Skill要进入生产,必须经过验证。Agent要自我进化,必须有一套能判断进化方向是否正确的私有化评测体系。
真正的模型能力评测不能只看外部榜单
这三个发现,共同指向同一个缺口:企业真正需要的,不只是model eval(模型评估),而是private eval(私有化评估)。
什么叫一次好的销售机会诊断?什么叫一个可被复用的专家判断?什么叫Agent真的改善了业务结果,而不是只生成了一份看起来漂亮的文档?
这些问题,通用模型公司无法替每家企业回答。答案藏在企业自己的业务目标、组织经验、隐性规则和管理判断里。
外部benchmark告诉你模型的通用能力,private eval才能告诉你AI是否真的在你的业务里创造价值。
正如纳德拉所说的“控制权测试”:如果明天换掉底层模型,企业积累的专家经验还在不在?如果不在,买到的只是外部能力;如果还在,才算真正沉淀了自己的智能资产。
这也是衔远大观MA进化引擎背后的设计逻辑:不是让Agent自己随便变,而是让Agent在评估、反馈、归因、沉淀和再训练中受控进化。
衔远大观:自主进化的智能资产引擎平台
沿着这个逻辑,衔远科技Frontis正在做的衔远大观Frontis Horizon,可以被更准确地定义为:自主进化的企业级智能资产引擎平台。
它不是传统的Agent编排工具,不是通用Agent平台工具,也不是简单的企业级OpenClaw。它真正要解决的是企业AI的更底层问题:
- 如何把通用模型能力,转化为企业自己的专业能力?
- 如何把专家经验,沉淀成可复用的Skill和Agent?
- 如何把工作流、业务规则、组织记忆和评测标准沉淀为企业自有知识产权?
- 如何让企业在替换底层模型时,仍然保留自己的DNA、Memory和Process?
- 如何让每一次使用,不只是完成任务,而是反哺下一次能力提升?
一句话:衔远大观要做的不是帮企业“使用AI”,而是帮企业拥有一套可持续进化的自有智能系统。
在衔远大观的架构里,这套系统分为三层:
第一层:ME(人的组织代理)
ME不是聊天机器人,也不是静态个人知识库,而是在企业语境中代表人持续推进工作的受治理代理。它理解人的目标、偏好、职责、权限、风险边界和历史上下文,可以帮助人过滤信息、生成判断、推进任务,并在关键节点请求确认。
ME的价值不是“像不像我”,而是“能不能代表我把工作推向前”。
举个例子,某客户的销售总监反馈,接入ME之后,他每周整理跟进计划的时间大幅压缩。但更重要的变化发生在三个月之后——他的ME已经积累了大量高质量销售判断案例,这些判断模式开始被复用于团队的新人培训。
ME不是概念。衔远已经把ME的核心能力产品化为Leadeep AI领衔者——一款面向职场人的AI录音与洞察产品。上述销售总监使用的,正是Leadeep AI领衔者,也就是ME能力的移动端产品化形态。
它做的事情,正是ME层设计的微缩版:记录人在真实工作场景中的判断和决策,提炼关键信息,在下一次同类场景中更快给出建议。618期间,Leadeep在社交媒体上引发自发传播,背后不是靠营销,而是因为很多用户第一次感受到“AI真的在帮我积累判断,而不只是帮我整理文字”。
第二层:WE(企业的硅基组织)
企业不是只有一个Agent,而是需要由多个角色化专家Agent组成的协同网络。
比如,在世界500强大宗商品贸易企业的大豆采购场景中:大宗市场分析专家、海运物流专家、合规风控专家以及财务成本专家等,组成供应链Agent专家团,协同完成大豆采购交易。结果是什么?降低交易风险的同时,将行业研究周期从天缩短到小时,物流规划周期从周缩短到天。
WE的关键不仅在于专家数量,更在于组织上下文。没有目标、权限、证据、接口、语义标准和治理边界,再多Agent只是噪声。有了组织上下文,一群Agent才能变成真正的硅基组织。
第三层:MA(组织级学习与控制系统)
没有MA,ME和WE只是一套执行系统。有了MA,组织才会在每一次执行中变得更聪明。
MA要记录行动、评估结果、追踪证据、分析偏差、沉淀经验、更新规则——把错误变成材料,把反馈变成训练信号,把一次次任务变成企业能力复利。
这也是从双环学习走向三环学习:不仅复盘动作对不对,也复盘策略对不对,还复盘组织结构、能力结构和流程规则是否应该被重构。
正如上述大豆采购Agent专家团案例,通过持续反馈和使用沉淀专家经验到Skill和Agent,从而构建私有化评估和持续进化的组织能力,大宗贸易企业得以更好地应对急剧变化的宏观形势和国际市场。
结语:AI原生能力的核心在于持续进化
行业里有一个常见误区:企业里有很多AI工具、很多Agent、很多自动化工作流,就算AI原生了。
但这仍是旧时代的理解方式——组织本体不变,只是多装了几个智能体;管理方式不变,只是流程跑得更快一点。
真正的AI原生,不是“原来的企业+AI工具”,而是企业本身开始被重新定义。
过去的数字化系统,大多解决的是记录问题:ERP记录交易,CRM记录客户,OA记录流程,BI展示指标。它们让企业变得更透明,但并没有改变一个底层事实:人仍然是唯一行动主体。
AI原生系统改变的正是这个前提。AI不再只是记录和展示,而是开始理解目标、调用工具、推进任务、生成交付、接收评价,并在反馈中持续学习。企业系统正在从System of Record走向System of Learning。从“记录企业”走向“进化企业”。
回到文章开头的问题:模型不是企业的护城河,那什么才是?
答案已经清晰:私有化评估 + 可持续进化能力。
私有化评估,让企业能判断AI是否真的在自己的业务里创造价值,而不是只看外部榜单选模型。可持续进化能力,让每一次任务执行、每一次专家反馈、每一次经营复盘,都能转化为可复用的知识、Skill和Agent。
同一个大模型,所有人都可以买。同一种Agent框架,所有企业都能接。但每家企业在长期经营中形成的客户理解、专家判断、流程细节和决策偏好,不会自动存在于通用模型里。
如果企业不能把这些东西沉淀下来,AI用得越多,越可能只是替外部模型训练了世界,而没有训练自己的组织。
当底层模型明天被换掉,企业积累的DNA、Memory和Process还在——那才是真正意义上的Token Capital,也才是这个时代企业真正的护城河。
相关链接: