欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

AI推荐系统背后的信息污染:215,128个机器生成的“最佳软件”页面如何操纵Perplexity

1970/1/1人工智能

一项调查发现,三个新域名通过机器生成超21万篇“最佳软件”文章,成为Perplexity AI答案的主要引用源,暴露出AI检索系统可被大规模SEO操纵的漏洞。

研究背景与动机

2026年9月,独立研究员Trellner开展了一项针对AI推荐系统的审计研究。研究动机源于一个日益严重的现象:当用户询问AI“哪个软件最好”时,AI会引用大量来源,但这些来源的可信度从未被系统检验。研究人员决定量化这个问题:AI到底在引用谁的“建议”?这些来源是否真实可靠?

研究的核心方法是:向Perplexity的两个模型(perplexity/sonar和perplexity/sonar-pro)提出380个“购买意向”类问题(涵盖“CRM软件”到“博物馆藏品管理软件”),要求每个问题返回前五名产品推荐及其官网域名。每个模型每个类别一次调用,共760次。所有调用均通过OpenRouter进行,因为这两个模型会报告它们检索了哪些URL,便于追踪引用来源。

惊人的数据发现

引用来源质量低到离谱

研究共获得7,534条引用,指向2,055个不同域名。分析显示:

  • 59.8%的引用指向在Tranco百万网站排名中低于第100,000名的域名(Tranco是常用的网站流量排名系统,类似Alexa)
  • 23.4%的引用指向完全不在前十亿名单中的域名
  • 这些引用中,域名首次被Wayback Machine(互联网档案馆)收录的中位年份是2020年(而排名靠前的网站多为2011年)
  • 16.6%的未排名域名是2025年或之后才首次被收录的,而排名域名中这一比例仅为1.6%

这说明AI引用的“高质量”来源实际上是大量新注册、低流量的网站。

引用集中度:头部效应不惊人,长尾才是问题

引用最集中的前十域名占全部引用的17.3%,这个集中度在正常范围内。真正的问题在于长尾:2,055个被引用域名中有751个(36.5%)根本没有进入Tranco前百万名。这些新域名正快速填充AI的知识库。

前十名引用源分析

域名 引用次数 占比 Tranco排名
g2.com 291 3.86% 4,027
reddit.com 261 3.46% 105
guideflow.com 194 2.57% 177,039
gartner.com 158 2.10% 1,766
zapier.com 82 1.09% 2,919
wifitalents.com 71 0.94% 105,281
capterra.com 68 0.90% 6,387
linkedin.com 67 0.89% 18
worldmetrics.org 60 0.80% 104,737
gitnux.org 50 0.66% 42,759

作为对比,维基百科(Wikipedia)在全部7,534条引用中仅出现3次。这说明AI的引用偏好明显偏离人类对权威来源的认知。

最诡异的现象:第三大引用源是一家营销博客

排名第三的guideflow.com是一家销售交互式产品演示的供应商。它不是评论网站、目录或出版商,也不在研究的任何380个软件类别中竞争。然而,它的博客被引用了194次,覆盖96个类别(占380个类别的四分之一),超过了老牌权威高德纳(Gartner)。

每个引用都是不同的URL:96个不同的guideflow.com博客URL,每个类别一个,其中有6个是爱沙尼亚语言版本。该网站的sitemap列出了3,351个博客URL,其中2,176篇是独特的文章。这些文章标题包括“3D渲染软件最佳推荐”、“IVR软件最佳选择”、“RFID软件工具”、“建筑设计软件指南”等,但实际上guideflow根本不在这些市场运营。

“事实与接地页面”(Facts & Grounding Page)

前十大引用源中,有三个网站尤其可疑:wifitalents.com(71次引用,27个类别)、worldmetrics.org(60次,22个类别)和gitnux.org(50次,23个类别)。它们合计贡献了181次引用,占总数2.4%,出现在41个类别中。

这些网站明显属于同一运营方:

  • 注册时间:均在2023年12月至2024年5月期间通过NameCheap注册
  • DNS服务器:都使用同一对Cloudflare域名服务器(pam.ns.cloudflare.com和sean.ns.cloudflare.com)
  • 页面模板:完全相同的导航结构(“服务、市场数据、软件建议、编辑流程、公司”)
  • 博客内容:每个网站只有6篇博客,且全部是关于其他同类网站的(如zipdo.co,也使用同一DNS服务器对)

最惊人的是它们的规模:三个网站的sitemap分别列出了103,578、107,083和105,541个URL,其中“/best/<某软件类别>页面”数量分别为70,731、71,684和72,713个。三个网站合计共发布215,128个机器生成的购买指南页面,而它们各自只有6篇文章。

当然,世界上不可能有215,128个软件类别——这只是针对AI检索优化的程序化内容农场。

自我描述的“接地”页面

这些网站最不同寻常之处在于自我定位。在2026年9月2日抓取时,worldmetrics.org和gitnux.org的HTML标题都显示为“<品牌名>——事实与接地页面”(Facts & Grounding Page),meta描述除了品牌名外完全一致:

关于Gitnux的验证事实:一家独立市场研究公司,发布行业统计、定制研究和软件最佳列表。公司、法律、方法论和合规细节在一个机器可读的记录中。

“接地”(Grounding)是检索增强生成(RAG)系统的术语,指通过抓取外部文档来为AI答案提供依据的过程。这不是普通买家会使用的用语——这是写给AI系统看的自我描述。这些页面在标题和描述中,直接面向检索它们的算法。

更直接的是,worldmetrics.org还公开提供“定制市场研究”(5000欧元起)、“现成报告”(499欧元起)和“供应商选择”(2500欧元起)服务,与它生成的“最佳列表”互为市场。

同一模板,三种答案

研究人员从三个网站抓取了相同的类别页面:“项目估算软件”。每个页面用JSON-LD(结构化数据)声明其排名,可直接读取。每个页面展示前五名:

排名 worldmetrics.org wifitalents.com gitnux.org
1 Float Float Saviom
2 Scoro Scoro Mosaic
3 Teamwork.com Teamwork.com Buildertrend
4 Procore Buildertrend Float
5 Wrike Apropo Teamwork.com

三个网站关于同一问题的答案各不相同,甚至Gitnux的冠军产品Saviom根本不在Worldmetrics的前五名单中。每个页面都声称有三位员工署名(如Worldmetrics列出Kathryn Blake、Alexander Schmidt、Victoria Marsh;Gitnux列出Diana Reeves等),总计九个人在回答同一个问题。每页都宣称遵循“编辑流程”,Gitnux还标注“AI验证·专家评审”。所有页面都包含一个未渲染的模板变量,其中两个显示“在接下来26天内”,另一个显示“在接下来40天内”——典型的机器生成痕迹。

对AI推荐的深层启示

这项研究揭示了几个关键问题:

  1. AI检索不区分内容质量:Perplexity等系统只是抓取网页,分析文本相关性,但缺乏对域名信誉、内容原创性和商业动机的基本判断。低质量内容农场能轻松进入AI的推荐生态。

  2. 机器生成内容正在伪装成“事实来源”:这些“事实与接地页面”明确针对AI检索优化,通过结构化数据、自指描述和大量长尾关键词捕捉AI的注意力。

  3. 供应商营销博客成为权威参考:一个不参与软件市场的公司博客竟然成为第三大引用源,建议购买它完全不竞争的产品,这是对“AI推荐中立性”的巨大讽刺。

  4. 规模化的冲击:215,128个页面相对于380个类别的测试来说只是冰山一角。当AI遇到这些页面时,它们看起来像是有价值的第三方内容,但实际上完全是机器生成的SEO产物。

  5. 对用户的实际影响:当用户依赖AI推荐选购软件时,实际证据表明AI会受这些低质量、机器生成内容的影响。这可能导致用户被引导到错误的软件,损害购买决策。

作者总结

这不是一个“AI被欺骗”的戏剧性故事,而是AI检索系统设计缺陷的系统性展示。当AI的基本假设是“网上可获取的内容都有参考价值”时,大规模的内容生成就能操纵它。Perplexity等平台需要建立更严格的来源信誉评估机制,区分真实用户评价、专业编辑推荐和机器生成的商业内容。对于普通用户,这项研究提醒我们:AI不是权威百科全书,它只是一个基于文本统计的模型,易受精心设计的低质内容影响。

原文链接:https://trellner.com/reports/manufactured-sources-behind-ai-recommendations/

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消