“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
安娜档案馆悬赏20万美元:批量获取谷歌图书扫描数据
安娜档案馆悬赏20万美元,寻求能规模化获取谷歌图书(或类似大型图书扫描库)全部扫描数据的方法,旨在保护人类文化知识遗产。
背景:谷歌图书与开放知识的博弈
谷歌图书(Google Books)项目始于2004年,目标是扫描全球所有已出版的书籍。经过近20年努力,谷歌已扫描超过4000万册图书,覆盖数百种语言,其中大量为19世纪及20世纪初的绝版书、稀有书。这些扫描数据本应成为人类知识的数字宝库,但谷歌出于版权和法律考虑,仅在搜索结果中展示“片段”(snippets),用户无法直接下载或阅读完整扫描页。
这种“只给看、不给拿”的模式,引发了学术界、图书馆界和数字权利倡导者的长期不满。因为许多扫描自大学图书馆的书籍,其版权状态早已进入公有领域,但谷歌仍然将其锁定在自家的搜索围墙内。安娜档案馆(Anna's Archive)正是致力于打破这种封锁,通过众包和悬赏方式,收集全球图书元数据及扫描文件,建立一个开放、可检索的巨型图书馆。
悬赏细节:20万美元的动机与条件
安娜档案馆在GitLab上正式发布Issue #234,悬赏20万美元(约合人民币145万元),面向所有有能力的人,寻找能够“规模化”获取谷歌图书完整扫描数据的方法。关键条款包括:
- 目标数据:谷歌图书中所有可获得的扫描文件(包括非版权限制的公共领域书籍),或其他类似规模的大型图书扫描库(例如AI公司为训练大模型而收集的扫描集,尤其是包含稀有书籍的集合)。
- 方法与验证:悬赏要求提供者必须展示一个可扩展的(scalable)原型方案。不能只是小批量手动下载,而是需要证明该方法能系统性地抓取数百万册书籍,且不触发谷歌的防御机制。
- 早期沟通:安娜档案馆鼓励发现潜在方法的人尽早联系,他们会提供资源帮助扩大规模(例如分布式代理、存储基础设施等)。
- 内部人士特别激励:悬赏公告特别提到,如果谷歌内部员工能“偷偷带出”这些数据,虽然20万美元对他们个人来说可能不算巨款,但他们将被铭记为“传奇档案管理员”。
- 范围扩展:悬赏不仅限于谷歌图书,也适用于其他拥有类似大型扫描库的机构,例如AI公司(如OpenAI、Meta等)为训练大语言模型而收集的图书扫描数据集。
技术挑战:为什么谷歌图书数据难以批量获取?
谷歌图书的访问控制并非简单的“下载按钮”,而是多层防护:
- 片段展示限制:对于受版权保护的书籍,谷歌只显示围绕搜索关键词的几行文字,且每本书的片段展示次数有限。即使对于公共领域书籍,谷歌也通过“预览”模式限制页数,通常只展示全书的一小部分,且每次请求需通过验证码或登录。
- 反爬虫机制:谷歌拥有业界最先进的反爬虫系统,包括IP限速、浏览器指纹检测、行为分析(如鼠标移动轨迹)、CAPTCHA验证等。任何大规模自动化请求都会被快速识别并封禁。
- 图像水印与切分:谷歌图书的扫描页图像通常带有水印(如“Google Books”字样),且可能被切分成碎片,需通过JavaScript重组才能看到完整页面。这使得直接下载原图变得困难。
- 法律与合同风险:即使技术可行,大规模抓取也可能违反谷歌的服务条款和相关版权法。安娜档案馆明确表示不承担法律风险,但悬赏本身可能被视为鼓励“黑客行为”。
历史案例:类似悬赏的成败
安娜档案馆并非第一个尝试“解放”谷歌图书数据的组织。早在2010年,就有黑客通过暴力破解预览页URL模式,尝试下载公共领域书籍,但谷歌很快修补了漏洞。2017年,一名研究人员利用谷歌图书的“预览所有页面”功能(针对部分书籍)编写脚本批量下载,但仅持续了几天就被封禁。
更成功的案例是Sci-Hub和Z-Library,它们通过众包(用户上传)和分布式节点,积累了数千万篇论文和数百万册图书。但Sci-Hub主要针对学术论文(PDF格式),而图书的扫描文件体积更大、格式更不统一(如DJvu、PDF、JPEG),存储和分发成本更高。
为什么是20万美元?经济账与价值判断
20万美元对于个人来说是一笔巨款,但对于谷歌这样的公司或大型AI企业来说,可能只是几个工程师的月薪。安娜档案馆的创始人“Anna”在公开信中解释,这个金额足以覆盖一个中等规模团队(3-5人)一年的努力,包括服务器租赁、代理IP购买、开发时间等成本。更重要的是,悬赏传递了一个信号:这些数据值得被解放,并且有人愿意为此买单。
从数据价值看,谷歌图书的扫描数据如果被完全释放,将包含数百万册公共领域书籍的原始高分辨率扫描件,这些书籍很多在实体图书馆中已经腐烂或被销毁。对于研究人员、历史学家、语言学家以及AI训练来说,这是无价之宝。例如,Meta的LLaMA模型训练中就使用了大量图书数据,但来源不明。如果有了完整的谷歌图书数据集,开源AI社区将能训练出更强大的语言模型。
潜在方法:可能的突破方向
虽然具体方法尚未公开,但社区讨论了几种可能的路径:
- 利用预览漏洞:部分书籍(尤其是早期扫描的)可能仍存在“全本预览”的未关闭入口,通过构造特定URL可以直接访问所有页面。需要系统化扫描漏洞。
- 分布式众包:类似SETI@home,开发一个浏览器插件,让志愿者在空闲时自动请求并上传谷歌图书的片段/页面,然后由中央服务器重组。但谷歌的验证码和限速会极大限制效率。
- 内部泄密:最直接的方式是谷歌员工或合作图书馆员利用权限导出数据。历史上,美国国家安全局(NSA)的斯诺登事件表明,内部人员的信息泄露可以造成巨大影响。
- 法律强制:通过诉讼迫使谷歌释放公共领域书籍的扫描数据。美国已有多个图书馆联盟起诉谷歌,要求其交出扫描件,但进展缓慢。
- AI图像重建:利用生成式AI(如GAN或扩散模型),从谷歌提供的碎片化片段中重建完整页面。但这种方法精度有限,且需要大量计算资源。
伦理与风险:开放知识 vs 版权保护
安娜档案馆的立场是激进的:他们认为知识属于全人类,不应被商业公司或法律条文所禁锢。但反对者指出,许多书籍的版权状态复杂,即使是公共领域书籍,谷歌也投入了巨大的扫描成本(每本书约30-50美元),直接“偷走”数据有违商业道德。此外,大规模数据泄露可能引发法律诉讼,安娜档案馆的服务器已经被多次查封。
悬赏公告中特意注明“请仔细阅读志愿者页面”,其中包含了法律免责声明:安娜档案馆不鼓励非法行为,但也不阻止。这种灰色地带的操作,正是数字时代知识获取与版权保护之间矛盾的缩影。
总结与展望
20万美元悬赏谷歌图书数据,不仅是技术挑战,更是一场关于知识所有权的社会实验。无论最终是否有人成功,这个悬赏本身已经引发了广泛讨论:在AI时代,谁应该拥有扫描后的书籍数据?公共领域书籍的数字化副本是否应该免费开放?商业公司与公共利益之间的平衡点在哪里?
对于技术爱好者来说,这或许是一个兼具挑战与意义的目标:既能证明自己的工程能力,又能为人类知识库做出贡献。但前提是,必须找到一种既高效又隐秘的方法,避开谷歌的层层防护。
原文链接:https://software.annas-archive.gl/AnnaArchivist/annas-archive/-/work_items/234