“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。
md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。
要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。
在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。
要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。
工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。
写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。
适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。
你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。
全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。
这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。
不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。
产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。
如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。
Topic Feasibility Screener:用AI自动化科研选题评估与实证预验证
一个基于AI的科研选题辅助工具,自动生成idea、检索文献、跑回归验证可行性并打分排名。
一、项目简介
Topic Feasibility Screener 是一个面向科研人员的Python工具,核心功能是将模糊的研究想法转化为结构化、可验证的选题方案。用户只需提供一份数据集(CSV格式),工具便会自动完成:
- 基于数据特征自动生成多个潜在研究题目(idea)
- 针对每个idea检索相关学术文献(通过Semantic Scholar API)
- 执行初步的回归分析验证实证可行性(如显著性、效应量、模型拟合度)
- 结合理论可行性(文献支持度)与实证可行性(统计结果)给出综合评分和排名
该工具由博士生lzh-phd开发,目前在GitHub上获得159颗星,用Python实现,依赖主流数据科学生态(pandas, statsmodels, scikit-learn等)。
二、痛点与解决方案
2.1 科研选题的三大困境
- 想法多但无法判断可行性:早期研究者常有大量模糊想法,但不确定哪个值得投入。传统做法是手动查文献、做预实验,周期长且容易放弃。
- 文献检索与实证验证脱节:很多选题在文献上看似新颖,但实际数据跑出来不显著;或者实证结果很好,但已有大量类似研究。缺乏一个“文献+数据”交叉验证的流程。
- 重复劳动:每个idea都要手动查文献、写回归代码、整理结果,对于非统计背景的研究者尤其痛苦。
2.2 解决方案
Topic Feasibility Screener 将上述流程自动化:
- 输入:一个包含自变量和因变量的数据集(CSV)
- 处理:自动识别变量类型 → 生成候选模型公式 → 检索文献 → 跑回归 → 计算可行性分数
- 输出:一个按分数排名的选题列表,每个选题附带文献摘要、回归结果、可行性解释
三、安装与使用
3.1 环境要求
- Python 3.8+
- 依赖包:pandas, numpy, statsmodels, scikit-learn, requests, tqdm
3.2 安装步骤
bash
克隆仓库
git clone https://github.com/lzh-phd/topic-feasibility-screener.git
cd topic-feasibility-screener
安装依赖
pip install -r requirements.txt
3.3 快速开始
假设你有一个关于教育数据集 education.csv,包含列:hours_study, attendance, parent_income, exam_score。
python
from topic_feasibility_screener import Screener
初始化
screener = Screener(
data_path='education.csv',
target_var='exam_score', # 因变量
api_key='your_semantic_scholar_key' # 可选,免费使用有限制
)
运行完整流程
results = screener.run()
查看排名前3的选题
for i, topic in enumerate(results.top3()):
print(f"Rank {i+1}: {topic.title}")
print(f" 实证得分: {topic.empirical_score:.2f}")
print(f" 文献支持: {topic.literature_score:.2f}")
print(f" 综合得分: {topic.composite_score:.2f}")
print(f" 关键文献: {topic.key_papers[:3]}")
print(f" 回归摘要: {topic.regression_summary}")
3.4 核心参数说明
| 参数 | 类型 | 说明 |
|---|---|---|
data_path |
str | CSV文件路径 |
target_var |
str | 因变量列名 |
max_ideas |
int | 自动生成的最大idea数(默认10) |
p_threshold |
float | 回归显著性的p值阈值(默认0.05) |
min_literature |
int | 每个idea至少需要检索的文献数(默认5) |
api_key |
str | Semantic Scholar API密钥(可选) |
四、核心架构与亮点
4.1 工作流程
输入数据 → 特征工程 → 候选模型生成 → 文献检索 → 回归验证 → 评分 → 排序输出
- 特征工程:自动识别连续/分类变量,处理缺失值,生成交互项
- 候选模型生成:基于变量组合自动生成线性模型、逻辑回归、交互效应模型等
- 文献检索:对每个候选模型的关键词组合,通过Semantic Scholar API检索相关论文,提取摘要和引用数
- 实证验证:使用statsmodels执行OLS或Logit回归,输出系数、p值、R²、AIC等
- 评分系统:
- 实证得分(60%权重):基于p值显著性、效应量大小、模型拟合度
- 文献得分(40%权重):基于相关文献数量、最新程度、引用热度
- 综合得分 = 实证×0.6 + 文献×0.4
4.2 技术亮点
- 自动化变量发现:不要求用户指定自变量,工具自动从所有列中组合候选模型
- 文献-实证双校验:避免“文献丰富但数据不支撑”或“数据显著但已有大量研究”的陷阱
- 可解释性输出:每个选题附带完整的回归表格和文献摘要,研究者可手动复核
- 轻量级:无需GPU,单机可运行,适合个人研究者
五、适用场景
| 场景 | 说明 |
|---|---|
| 硕博开题 | 快速评估多个潜在选题的可行性,节省2-4周预研时间 |
| 跨学科研究 | 当研究者对新领域不熟悉时,自动发现可能的变量关系 |
| 论文投稿前验证 | 在正式分析前快速检查数据是否支持假设 |
| 课程项目选题 | 学生用少量数据快速找到可行的分析方向 |
不适用场景:
- 需要复杂因果推断(如DID、RDD、工具变量)的选题
- 非结构化数据(文本、图像、音频)
- 时间序列或面板数据(当前仅支持截面数据)
六、同类项目对比
6.1 与现有工具对比
| 工具 | 定位 | 自动化程度 | 文献检索 | 实证验证 | 输出形式 |
|---|---|---|---|---|---|
| Topic Feasibility Screener | 选题可行性预评估 | 全自动 | ✅ | ✅ | 评分排名+回归表 |
| ResearchRabbit | 文献发现与可视化 | 半自动(需手动输入) | ✅ | ❌ | 文献图谱 |
| Connected Papers | 文献关系图 | 半自动 | ✅ | ❌ | 图形化网络 |
| Elicit | 文献问答与提取 | 半自动 | ✅ | ❌ | 文献摘要表 |
| SciSpace | 论文解释与辅助 | 半自动 | ✅ | ❌ | 论文解读 |
| AutoML (如H2O) | 自动模型训练 | 全自动 | ❌ | ✅ | 模型性能排名 |
核心差异:
- 现有工具要么只做文献分析(ResearchRabbit, Connected Papers),要么只做模型训练(AutoML),但没有工具将选题生成、文献检索、实证验证三者结合并输出可行性分数。
- Topic Feasibility Screener 填补了“从想法到初步验证”的自动化空白。
6.2 优势与不足
优势:
- 全流程自动化,从数据到可行性报告只需一行代码
- 双维度评分(实证+文献)更全面
- 开源免费,可自定义评分权重
不足:
- 仅支持截面数据的线性/逻辑回归,不支持复杂模型
- 文献检索依赖Semantic Scholar API,免费版有速率限制
- 生成的idea基于变量组合,可能遗漏非线性关系
- 评分机制简单线性加权,未考虑领域差异
七、总结与展望
Topic Feasibility Screener 是一个将AI辅助研究理念落地为实用工具的典型案例。它不试图取代研究者的创造力,而是通过自动化完成重复性、机械性的预研工作,让研究者将精力集中在真正需要洞察力的部分——选题的深度思考与理论构建。
对于正在开题或探索新方向的研究者,这个工具可以:
- 在几小时内完成原本需要数周的预研
- 避免在“不可行”的选题上浪费大量时间
- 提供文献和实证的双重证据支持
未来潜在改进方向:
- 支持更多模型类型(混合效应模型、非线性模型)
- 集成更多文献数据库(如PubMed, arXiv)
- 加入因果图自动发现功能
- 提供Web界面降低使用门槛
八、项目链接
GitHub: https://github.com/lzh-phd/topic-feasibility-screener