欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

安娜档案馆悬赏20万美元:如何大规模抓取Google Books所有扫描书籍

2026/7/4创业商业

安娜档案馆悬赏20万美元,征集能大规模抓取Google Books(或类似规模)全部扫描书籍的技术方案或内部泄露途径。

背景:Google Books 的“可见不可得”困境

Google Books 是互联网上最大的书籍扫描项目之一,自2004年起,Google 与全球图书馆合作,扫描了超过4000万册图书。然而,这些扫描件并不向公众提供完整下载。用户在搜索时,只能看到围绕关键词的“小片段”(snippets),即搜索结果周围显示的几行文字。Google 通过这种“搜索+片段”模式,既展示了内容,又控制了完整数据的流出。

对于研究者、数字人文领域学者、书籍爱好者以及致力于保存知识的档案馆(如 Anna’s Archive)而言,这种限制意味着:大量已数字化的人类知识被锁在一个“只读”的围墙花园里。Anna’s Archive 是一个致力于永久保存人类知识的非营利项目,他们此前已成功抓取了 Library Genesis、Sci-Hub、Z-Library 等大型图书馆的镜像数据,但 Google Books 一直是难以攻克的堡垒。

悬赏细则:20万美元的“抓取挑战”

2025年,Anna’s Archive 在 GitLab 上发布了一个公开议题(Issue #234),正式悬赏 20万美元,征集能够“大规模抓取 Google Books 所有扫描书籍”的方法或数据泄露途径。关键点如下:

  1. 目标数据:Google Books 的全部扫描书籍(估计数千万册),或其他类似规模的收藏(例如由 AI 公司收集的书籍数据集),尤其鼓励包含稀有书籍的收藏。
  2. 技术前提:方法必须具有可扩展性(scalable),即不能是手动逐页下载,而应该能自动化、并行化地获取完整 PDF 或高质量扫描件。
  3. 验证要求:如果发现了一个看起来有潜力的方法,请先联系 Anna’s Archive 团队,并提供原型(prototype)。团队可能会帮助扩展规模(例如提供服务器、带宽或协调资源)。
  4. 内部人员特别通道:如果读者本人是 Google 员工,且有权访问这些数据,悬赏方坦言“20万美元对你来说可能不算什么”,但强调“如果你能偷偷带出这些数据,你将被誉为传奇档案管理员”。

技术难点:为什么 Google Books 如此难抓?

Google Books 的反爬虫和内容保护机制是业界顶级的,具体包括:

  • 动态片段生成:每次搜索请求返回的不是整页图像,而是经过 OCR(光学字符识别)后提取的文本片段。这些片段被精心裁剪,无法直接拼合成完整页面。
  • 图像混淆与分块:即使是预览页面,Google 也会将页面图像切成多个小图块(tiles),并通过 JavaScript 动态加载、随机化命名,使得直接下载图片并拼接变得极其困难。
  • IP 限制与速率控制:大规模请求会触发 CAPTCHA(验证码)或 IP 封禁。Google 对同一 IP 的请求频率有严格阈值。
  • 会话与 Cookie 追踪:需要维持复杂的登录状态和会话令牌,且不同区域、不同账户的权限不同。
  • 法律与版权风险:即使技术上可行,大规模下载受版权保护的书籍可能违反美国《数字千年版权法案》(DMCA)以及 Google 的服务条款。

因此,历史上虽然有人尝试过用分布式代理池、浏览器自动化(如 Selenium/Playwright)结合图像识别来抓取预览页,但速度极慢,且极易被检测。要抓取数千万册书籍,需要的不是“一个脚本”,而是一整套基础设施和反检测策略。

悬赏背后的动机:知识保存的“最后一公里”

Anna’s Archive 并非第一个试图攻破 Google Books 的组织。2017年,一位匿名黑客曾声称通过利用 Google Books 的 API 漏洞获取了部分书籍,但很快被修复。2020年,有研究者尝试用“搜索所有可能短语”的方法(即穷举搜索)来重建书籍全文,但受限于搜索配额和计算成本。

悬赏20万美元,反映了 Anna’s Archive 对这批数据价值的极高评估。与 Sci-Hub 主要聚焦于学术论文不同,Google Books 包含大量绝版书、古籍、非英语书籍,这些在物理世界中可能已经不存在或极难获取。将这批数据释放到公共领域,相当于一次性拯救了数百万本濒危书籍。

可能的技术方向(基于社区讨论)

截至2025年,社区中流传的潜在方法包括:

  1. 利用 Google 内部 API 的未公开端点:Google Books 在移动端或某些旧版协议中可能存在未完全关闭的批量下载接口。需要逆向工程或内部文档泄露。
  2. 利用 AI 公司的数据泄露:许多 AI 公司(如 OpenAI、Meta、Anthropic)在训练大模型时,曾购买或抓取过 Google Books 的数据。如果这些公司内部有人能导出训练集,则相当于间接获取了 Google Books 扫描件。
  3. 分布式志愿者爬虫:类似于 SETI@home 或 Folding@home,让全球志愿者在浏览器中运行一个轻量级爬虫,每个志愿者贡献少量请求,汇总后通过中央服务器拼接。但需要解决信任、安全和数据一致性难题。
  4. 法律/政策突破口:推动立法要求 Google 公开已扫描的公共领域书籍(例如1929年之前的书籍),或者通过诉讼迫使 Google 开放数据。但这属于长期策略,与悬赏的技术要求不直接相关。

悬赏的附加说明与风险

  • 请先阅读完整指南:Anna’s Archive 在 volunteering#bounties 页面详细说明了悬赏工作的流程、支付方式和法律责任豁免。
  • 早期沟通:不要花几个月完全实现后再联系,而是有初步原型时就沟通,团队可能提供资源加速。
  • 匿名性:鉴于法律风险,Anna’s Archive 支持匿名提交,并会协助保护贡献者身份。
  • 奖金支付:通常通过加密货币(如 Bitcoin 或 Monero)支付,以保障隐私。

总结

这不仅仅是一个技术挑战,更是一场关于“知识应该属于谁”的宣言。20万美元的悬赏,反映了数字时代下公共知识保存的极端困境:一边是拥有完整数据的科技巨头,一边是渴望开放获取的全球社区。无论最终是否有人成功领走这笔奖金,这个悬赏本身已经推动了社区对 Google Books 抓取技术的讨论,并可能催生新的工具或漏洞发现。

原文链接:https://software.annas-archive.gl/AnnaArchivist/annas-archive/-/work_items/234

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消