“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
20万美元悬赏:如何批量获取Google Books全部扫描书籍
安娜档案馆悬赏20万美元,寻找能规模化获取Google Books或类似大型扫描书籍数据集的方法,旨在拯救被版权壁垒封锁的人类知识。
背景:一个数字图书馆的困境
安娜档案馆(Anna's Archive)是一个致力于保存人类知识的非营利性数字图书馆项目,其核心使命是搜集、整理并长期保存全球的图书、论文和学术资料。然而,与Google Books等商业项目不同,安娜档案馆面临一个根本性的技术挑战:如何从那些只提供有限预览(如搜索片段)的系统中,完整地获取整本书的扫描数据。
Google Books自2004年启动以来,已经扫描了超过4000万册图书,其中许多是绝版、稀有或仅存少数副本的珍贵文献。但普通用户通过Google Books只能看到基于搜索关键词的“小片段”预览——通常只有几行文字,无法获取完整内容。这种设计既是出于版权保护,也是商业策略的一部分。
悬赏细节:20万美元的挑战
安娜档案馆在GitLab上发布了一份正式的工作项(Issue #234),明确悬赏20万美元(约合140万人民币)给能够解决这个问题的个人或团队。悬赏的核心要求是:
- 目标数据集:Google Books的全部扫描书籍(或同等规模的其他数据集,如AI公司收集的稀有图书集合)
- 技术前提:必须是一种可规模化(scale up)的方法,而非一次性手工操作
- 验证流程:在正式投入大规模工作前,需先提交原型(prototype)并与安娜档案馆团队沟通,确认方案可行性和扩展性
- 特殊身份:如果应征者是Google内部员工,可以直接访问该数据,悬赏方坦承20万美元对Google员工来说不算大数目,但强调“如果你能偷偷带出这些数据,你将被誉为传奇档案管理员”
技术难点分析
1. 反爬虫与访问限制
Google Books对书籍内容实施了多层保护:
- 片段预览:仅展示与搜索词相关的几行文字,且每次搜索返回的片段有限
- 频率限制:短时间内大量请求会触发CAPTCHA或IP封禁
- 会话管理:需要维持登录状态和合理的请求间隔
- 动态渲染:页面内容通过JavaScript动态加载,静态抓取无法获取完整数据
2. 版权与法律风险
Google Books的扫描书籍包含大量受版权保护的作品(包括孤儿作品和绝版书)。即使技术上可行,大规模下载也可能违反《数字千年版权法》(DMCA)等法律。安娜档案馆本身因其活动面临法律挑战,这也是悬赏强调“联系团队”的原因之一——他们可能需要评估法律风险。
3. 规模化瓶颈
假设Google Books有4000万册书,每本书平均300页,总页数超过120亿。即使每秒下载10页,也需要约380年才能完成。因此,任何可行方案必须:
- 利用并行下载(多线程、分布式节点)
- 优化请求策略(如优先下载稀有书籍)
- 绕过片段限制(例如通过构造大量不同搜索词来拼凑全文)
可能的实现思路
方法一:搜索词枚举法
通过构造大量不同的搜索词(如常见单词、词组、ISBN号等),让Google Books返回不同片段,然后利用文本拼接算法重建整页内容。这种方法需要:
- 一个庞大的搜索词库(数十亿级别)
- 高效的片段去重和排序算法
- 处理重叠片段和缺失部分的插值策略
方法二:浏览器自动化欺骗
使用Selenium或Puppeteer等工具模拟真实用户行为,通过控制浏览器窗口大小、滚动速度、鼠标移动轨迹等,绕过行为检测。但Google会监控异常模式(如无鼠标移动、固定时间间隔)。
方法三:内部泄密(针对Google员工)
悬赏方明确提及了内部泄密的可能性。Google Books的完整扫描数据存储在内部服务器上,拥有适当权限的员工可能通过批量导出或API漏洞获取。但风险极高:Google有严格的数据访问审计系统,异常下载会被立即发现。
方法四:合作与合法途径
安娜档案馆可能愿意与Google或AI公司合作,通过学术研究、文化遗产保护等名义获取授权。但悬赏金额暗示他们对合法途径不抱太大希望。
悬赏的深层意义
这不仅仅是20万美元的金钱奖励。安娜档案馆的创始人(化名“Anna”)在社区中强调,这个悬赏是“最后的努力”——如果无法通过技术手段获取这些数据,人类知识的数字保存将面临巨大缺口。许多19世纪和20世纪早期的书籍已经因纸张酸化而物理降解,Google Books的扫描可能是这些内容的唯一数字副本。
后续进展与社区反应
截至2025年,该悬赏在Hacker News上获得了246分和124条评论,成为热门话题。评论中既有技术讨论(如使用分布式爬虫、OCR后处理),也有对法律和道德边界的争论。安娜档案馆在Matrix聊天室(#annas:archivecommunication.org)中与开发者保持沟通,并建议感兴趣的参与者先阅读他们的志愿者指南(https://annas-archive.li/volunteering#bounties)。
值得注意的是,悬赏页面要求使用adguard-mail.com或mailinator.com等匿名邮箱注册,以避免被追踪。这反映了安娜档案馆对隐私和安全的高度重视。
结语
20万美元悬赏的实质,是人类知识保存者与商业巨头之间的一场不对称战争。Google Books拥有技术、法律和资本优势,而安娜档案馆只有社区的热情和开源精神。无论最终是否有人能领取这笔赏金,这个悬赏本身已经揭示了一个关键问题:在数字时代,谁应该拥有对文化记忆的控制权?
原文链接:https://software.annas-archive.gl/AnnaArchivist/annas-archive/-/work_items/234