欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

安娜档案馆悬赏20万美元:批量获取谷歌图书扫描数据

2026/7/4创业商业

安娜档案馆悬赏20万美元,寻求能规模化获取谷歌图书(或类似大型图书扫描库)全部扫描数据的方法,旨在保护人类文化知识遗产。

背景:谷歌图书与开放知识的博弈

谷歌图书(Google Books)项目始于2004年,目标是扫描全球所有已出版的书籍。经过近20年努力,谷歌已扫描超过4000万册图书,覆盖数百种语言,其中大量为19世纪及20世纪初的绝版书、稀有书。这些扫描数据本应成为人类知识的数字宝库,但谷歌出于版权和法律考虑,仅在搜索结果中展示“片段”(snippets),用户无法直接下载或阅读完整扫描页。

这种“只给看、不给拿”的模式,引发了学术界、图书馆界和数字权利倡导者的长期不满。因为许多扫描自大学图书馆的书籍,其版权状态早已进入公有领域,但谷歌仍然将其锁定在自家的搜索围墙内。安娜档案馆(Anna's Archive)正是致力于打破这种封锁,通过众包和悬赏方式,收集全球图书元数据及扫描文件,建立一个开放、可检索的巨型图书馆。

悬赏细节:20万美元的动机与条件

安娜档案馆在GitLab上正式发布Issue #234,悬赏20万美元(约合人民币145万元),面向所有有能力的人,寻找能够“规模化”获取谷歌图书完整扫描数据的方法。关键条款包括:

  • 目标数据:谷歌图书中所有可获得的扫描文件(包括非版权限制的公共领域书籍),或其他类似规模的大型图书扫描库(例如AI公司为训练大模型而收集的扫描集,尤其是包含稀有书籍的集合)。
  • 方法与验证:悬赏要求提供者必须展示一个可扩展的(scalable)原型方案。不能只是小批量手动下载,而是需要证明该方法能系统性地抓取数百万册书籍,且不触发谷歌的防御机制。
  • 早期沟通:安娜档案馆鼓励发现潜在方法的人尽早联系,他们会提供资源帮助扩大规模(例如分布式代理、存储基础设施等)。
  • 内部人士特别激励:悬赏公告特别提到,如果谷歌内部员工能“偷偷带出”这些数据,虽然20万美元对他们个人来说可能不算巨款,但他们将被铭记为“传奇档案管理员”。
  • 范围扩展:悬赏不仅限于谷歌图书,也适用于其他拥有类似大型扫描库的机构,例如AI公司(如OpenAI、Meta等)为训练大语言模型而收集的图书扫描数据集。

技术挑战:为什么谷歌图书数据难以批量获取?

谷歌图书的访问控制并非简单的“下载按钮”,而是多层防护:

  1. 片段展示限制:对于受版权保护的书籍,谷歌只显示围绕搜索关键词的几行文字,且每本书的片段展示次数有限。即使对于公共领域书籍,谷歌也通过“预览”模式限制页数,通常只展示全书的一小部分,且每次请求需通过验证码或登录。
  2. 反爬虫机制:谷歌拥有业界最先进的反爬虫系统,包括IP限速、浏览器指纹检测、行为分析(如鼠标移动轨迹)、CAPTCHA验证等。任何大规模自动化请求都会被快速识别并封禁。
  3. 图像水印与切分:谷歌图书的扫描页图像通常带有水印(如“Google Books”字样),且可能被切分成碎片,需通过JavaScript重组才能看到完整页面。这使得直接下载原图变得困难。
  4. 法律与合同风险:即使技术可行,大规模抓取也可能违反谷歌的服务条款和相关版权法。安娜档案馆明确表示不承担法律风险,但悬赏本身可能被视为鼓励“黑客行为”。

历史案例:类似悬赏的成败

安娜档案馆并非第一个尝试“解放”谷歌图书数据的组织。早在2010年,就有黑客通过暴力破解预览页URL模式,尝试下载公共领域书籍,但谷歌很快修补了漏洞。2017年,一名研究人员利用谷歌图书的“预览所有页面”功能(针对部分书籍)编写脚本批量下载,但仅持续了几天就被封禁。

更成功的案例是Sci-Hub和Z-Library,它们通过众包(用户上传)和分布式节点,积累了数千万篇论文和数百万册图书。但Sci-Hub主要针对学术论文(PDF格式),而图书的扫描文件体积更大、格式更不统一(如DJvu、PDF、JPEG),存储和分发成本更高。

为什么是20万美元?经济账与价值判断

20万美元对于个人来说是一笔巨款,但对于谷歌这样的公司或大型AI企业来说,可能只是几个工程师的月薪。安娜档案馆的创始人“Anna”在公开信中解释,这个金额足以覆盖一个中等规模团队(3-5人)一年的努力,包括服务器租赁、代理IP购买、开发时间等成本。更重要的是,悬赏传递了一个信号:这些数据值得被解放,并且有人愿意为此买单。

从数据价值看,谷歌图书的扫描数据如果被完全释放,将包含数百万册公共领域书籍的原始高分辨率扫描件,这些书籍很多在实体图书馆中已经腐烂或被销毁。对于研究人员、历史学家、语言学家以及AI训练来说,这是无价之宝。例如,Meta的LLaMA模型训练中就使用了大量图书数据,但来源不明。如果有了完整的谷歌图书数据集,开源AI社区将能训练出更强大的语言模型。

潜在方法:可能的突破方向

虽然具体方法尚未公开,但社区讨论了几种可能的路径:

  1. 利用预览漏洞:部分书籍(尤其是早期扫描的)可能仍存在“全本预览”的未关闭入口,通过构造特定URL可以直接访问所有页面。需要系统化扫描漏洞。
  2. 分布式众包:类似SETI@home,开发一个浏览器插件,让志愿者在空闲时自动请求并上传谷歌图书的片段/页面,然后由中央服务器重组。但谷歌的验证码和限速会极大限制效率。
  3. 内部泄密:最直接的方式是谷歌员工或合作图书馆员利用权限导出数据。历史上,美国国家安全局(NSA)的斯诺登事件表明,内部人员的信息泄露可以造成巨大影响。
  4. 法律强制:通过诉讼迫使谷歌释放公共领域书籍的扫描数据。美国已有多个图书馆联盟起诉谷歌,要求其交出扫描件,但进展缓慢。
  5. AI图像重建:利用生成式AI(如GAN或扩散模型),从谷歌提供的碎片化片段中重建完整页面。但这种方法精度有限,且需要大量计算资源。

伦理与风险:开放知识 vs 版权保护

安娜档案馆的立场是激进的:他们认为知识属于全人类,不应被商业公司或法律条文所禁锢。但反对者指出,许多书籍的版权状态复杂,即使是公共领域书籍,谷歌也投入了巨大的扫描成本(每本书约30-50美元),直接“偷走”数据有违商业道德。此外,大规模数据泄露可能引发法律诉讼,安娜档案馆的服务器已经被多次查封。

悬赏公告中特意注明“请仔细阅读志愿者页面”,其中包含了法律免责声明:安娜档案馆不鼓励非法行为,但也不阻止。这种灰色地带的操作,正是数字时代知识获取与版权保护之间矛盾的缩影。

总结与展望

20万美元悬赏谷歌图书数据,不仅是技术挑战,更是一场关于知识所有权的社会实验。无论最终是否有人成功,这个悬赏本身已经引发了广泛讨论:在AI时代,谁应该拥有扫描后的书籍数据?公共领域书籍的数字化副本是否应该免费开放?商业公司与公共利益之间的平衡点在哪里?

对于技术爱好者来说,这或许是一个兼具挑战与意义的目标:既能证明自己的工程能力,又能为人类知识库做出贡献。但前提是,必须找到一种既高效又隐秘的方法,避开谷歌的层层防护。

原文链接:https://software.annas-archive.gl/AnnaArchivist/annas-archive/-/work_items/234

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消