
大家好,我是某白。
Claude Science 类似的平台有许多,名字也很容易让人看花眼。Open Science Desktop 和 OpenScience 只差一个空格,看起来像同一个项目。另两款的介绍也很类似,都包含文献、实验、代码和论文。
我把这些项目重新梳理了一遍,发现这四款科研 AI 工具根本不在同一层。
有的是桌面工作台,帮你管好文件、Notebook 和实验记录。有的是浏览器科研代理,拿到目标后继续安排任务。还有两款更像研究原型,重点是让 AI 自己找方向、跑实验,再从失败中总结经验。
所以这篇不按功能多少排座次,也不拿 Star 数判断好坏。我只回答一个问题:你手头是什么任务,该选哪一款?
需要提前说明:各个项目更新很快,版本、界面和功能请以你实际安装时看到的内容为准。
四款 Claude Science 开源替代,先按类型分清
把四个项目摆在一起,大致可以分成三类。
|
工具 |
产品形态 |
人怎么参与 |
更适合什么任务 |
|---|---|---|---|
|
Open Science Desktop |
本地优先的桌面科研工作台 |
人掌握流程,AI协助执行 |
文献、数据、Notebook、图表和报告放在一个工作区 |
|
Synthetic Sciences OpenScience |
命令行启动的浏览器科研工作台 |
人给目标,在关键节点介入 |
从文献、假设、代码到实验报告的连续任务 |
|
EvoScientist |
自进化多智能体科研系统 |
人设定方向,系统跨任务积累经验 |
研究想法搜索、实验策略迭代、长期记忆研究 |
|
AutoResearchClaw |
23阶段自主科研流水线 |
可全自动,也可设置人工检查点 |
需要辩论、自修复、结果核验和论文写作的完整流程 |
这张表也解释了为什么“谁更强”很难回答。
Open Science Desktop 解决的是日常工作环境。EvoScientist 研究的是 AI 如何越做越会做。AutoResearchClaw 关心失败后怎么修、结果怎么核验。它们处理的问题不同,硬排成一条榜单反而会误导。

五款科研 AI 工具定位图
Open Science Desktop:想要桌面科研工作台,先看它
如果你用 Windows,平时离不开 Python 和 Jupyter,可以先看 Open Science Desktop。四款工具中,它最接近日常科研环境。
它支持 Windows、macOS 和 Linux。材料把它称为本地优先、模型无关、强调复现记录的桌面工作台。文件、Notebook、图表、报告、运行日志和审查流程,都可以放进同一个工作区。
这和普通聊天框差别很大。
假设我要分析一份实验数据。普通 AI 往往给我一段代码,我再复制到本地运行。报错了,我把错误贴回去。图画完后来,代码、参数和结果散在几个窗口里。
在桌面工作台里,AI 可以操作 Notebook,运行 Python 或 R。图表、报告、运行记录和输入文件都能留在项目中。后来回头查结果,不必只靠聊天记录猜当时做过什么。

Open Science Desktop 工作区示意图
Open Science Desktop 还支持 Skills 和 MCP。前者保存任务步骤。后者把 arXiv、PubMed、Crossref 等来源接进工作流。对科研任务来说,这两类扩展比“能聊多少轮”更实在。
模型也不必绑死在一家服务商。材料显示,它可以配置不同模型提供商,也能连接兼容 OpenAI 接口的服务。便宜模型可以筛文献、整理文件,强模型负责研究判断和结果审查,敏感任务还可以思考本地模型。
这里有个容易误解的地方:本地优先不等于所有信息永远不离开电脑。
文件和代码可以在本地处理,但只要调用云端模型,发给模型的内容仍会进入对应服务商。是否适合敏感数据,要看模型配置、请求内容和机构规定,不能只看“本地”两个字。
它更适合以下情况:
-
主要在 Windows 或桌面环境工作;
-
已经习惯 Python、R 或 Jupyter;
-
希望保留文件、参数、图表和运行日志;
-
想自己决定用什么模型和科研技能;
-
愿意花时间配置环境并检查 AI 生成的代码。
如果你只想问几个文献问题,桌面工作台反而显得重。不愿处理 Python、路径和依赖,也很难用得顺手。工具装好了,不代表研究流程会自动变清楚。
官方也把 Open Science Desktop 定义为 Beta 研究工具。它生成的数字、引用、代码和结论都只能当草稿,发表或据此决策前仍要逐项核验。
Synthetic Sciences OpenScience:喜爱命令行和浏览器工作区,可以看它
第二款也叫 OpenScience,但来自 Synthetic Sciences。它和 Open Science Desktop 不是同一个项目。
它从命令行启动本地服务,再打开浏览器工作区。材料描述的界面包含文件树、编辑器、终端和会话记录。代码与数据主要在本机处理,模型推理请求发给用户配置的模型服务商。
它的卖点是把科研任务连成一条研究循环。
用户给出目标后,科研代理可以继续检索文献、形成假设、写代码、跑实验、分析数据,再整理报告。过程中可以切到只读计划模式,也能在关键决定前让人确认。

Synthetic OpenScience 浏览器工作区示意图
官方 README 当前列出 290 多个科研 Skills,并接入 UniProt、PDB、Ensembl、ChEMBL、PubChem、arXiv、OpenAlex、Semantic Scholar 等数据库,以及约 30 个其他数据源。熟悉命令行、想改工作流的科研程序员,会更容易用好这种开放结构。
但“技能多”不能直接换算成“研究做得好”。
技能数量说明覆盖面广,不说明每个领域都有足够深的科学判断。数据库能查到,也不代表引用已经核准。代码能够启动,更不等于实验设计成立。
现有材料还反复提到一个问题:项目发布时间不长,公开的真实科研案例不足。它目前展示了很完整的工程框架,但框架能否长期服务真实课题,还要看后续使用和验证。
它更适合以下情况:
-
习惯命令行和浏览器式开发环境;
-
希望在一个任务中切换不同模型;
-
想把文献、代码、实验和报告串起来;
-
需要修改 Skills、插件或数据库连接方式;
-
能看懂权限提示,并愿意用容器或虚拟机隔离高风险代码。
如果你期待的是双击安装、登录即用,它未必比桌面端省心。如果实验数据很重大,也不要让刚装好的科研代理直接在原目录里随意执行命令。
EvoScientist:它研究的重点,是让 AI 记住失败
EvoScientist 已经不只是早期论文里的研究原型。当前 v0.2.2 提供桌面 WebUI、CLI/TUI、定时任务和多渠道接入,也能把记忆中的重复规律整理成可复用 Skills。
不过,它和普通桌面工作台仍有区别。EvoScientist 最值得看的部分,依然是 AI 做完一次研究后来,能不能把经验带到下一次任务。
它关注的问题更难:AI 做完一次研究后来,能不能把经验带到下一次任务?
许多科研代理每次启动都像刚入组。上一个任务里试过的失败路线,下次还可能再走一遍。数据清洗踩过的坑、超参数调优留下的经验,也很难跨任务复用。
EvoScientist 用三个智能体和两套记忆处理这件事。
Researcher Agent 负责寻找想法,通过多轮审查筛选方向。Engineer Agent 写代码、跑基线、调参数,再做方法实验和消融。
任务结束后,Evolution Manager Agent 整理经验。方向判断存入 Ideation Memory。数据处理和训练策略则存入 Experimentation Memory。
下一次遇到相近课题,系统可以先查过去的经验。哪些方向有希望,哪些方向因数据、算力或实验条件失败,都不必完全从头摸索。

EvoScientist 三智能体与两套记忆架构图
这套思路很像科研组里的实验记录。成功结果当然要留,失败缘由更该留。只记最终精度,不记中间走过的弯路,换个课题仍会重复花时间。
知识库材料称,EvoScientist 生成的 6 篇论文均获 ICAIS 2025 AI Scientist Track 接收。其中两篇获奖。
这个结果值得关注,但不能直接推成“AI 已经能独立做科研”。
六篇论文来自特定赛道和评估环境。它能说明这套机制有研究价值,却不能替代不同学科、不同数据和不同审稿标准下的长期检验。
我更愿意把 EvoScientist 看成一套围绕科研经验积累生长出来的产品。它适合研究多智能体、自主实验和长期记忆的人,也适合想参考其架构搭建内部科研代理的团队。
如果只想读文献、处理 CSV 或写一段 Python,直接上 EvoScientist 仍有些舍近求远。它虽然有 WebUI,但核心长处还是跨任务记忆和自进化。
AutoResearchClaw:完整之外,更看重实验失败后的处理
AutoResearchClaw 也在做自主科研。它把研究过程分成 23 个阶段。
当前 v0.5.0 已把 ARC-Bench 扩展到 55 个任务,覆盖机器学习、高能物理、量子、生物和统计。论文最初报告的是 25 个核心机器学习任务,以及后续的跨领域扩展;阅读不同版本的数据时要分清口径。
这些阶段归入发现、实验和写作三部分。系统在关键位置安排多智能体辩论、自修复执行、结果核验、人工检查和跨轮次经验复用。
它最值得看的地方,不是“从想法到论文”这句口号,而是如何限制系统乱写结果。
实验阶段出现错误后,系统会诊断依赖、修改代码、重跑,再决定继续优化还是更换方向。写作阶段只能从只读结果登记表中取数。关键结论如果找不到对应实验记录,就拒绝写入或留下待补位置。
引用也有单独的核验步骤。系统检查 DOI、OpenAlex 和 arXiv 等信息,再标出可疑或疑似虚构的引用。
这套设计抓住了自动科研最危险的一处:文章写得流畅,实验数字却没有来路。
AutoResearchClaw 还准备了不同的人机协作模式。你可以让它全自动运行,也可以只在关键关口检查,或者采用协作模式,在少数重大节点介入。
论文还做了 10 个课题的内部评估。协作模式有 8 个课题产出有效结果,其中 7 个达到论文设定的质量阈值,内部“Accept”比例为 87.5%。这里的 Accept 指质量评分不低于 5 分,不是外部会议录用率。
逐步人工干预的次数更多,结果却没有随之同步提高。样本很小,但它提示了一件实用的事:人不必盯着每一步,关键处做判断更有价值。

AutoResearchClaw 发现、实验与写作流程图
它更适合以下情况:
-
想研究完整的自主科研管道;
-
在意实验失败后的修复和方向调整;
-
要求数字、引用和结论能够追溯;
-
希望设置人工检查点;
-
有条件提供容器、算力和较强模型。
代价也很明显。23 个阶段意味着更复杂的环境、更长的运行时间和更高的模型成本。论文里的基准成绩也不能保证它在你的化学、生物或材料课题上同样有效。
如果没有稳定的数据、算力和评价标准,自动跑完整流程只会更快地产生一大堆难以判断的中间文件。
Biomni:如果已有成熟的领域智能体,未必需要通用工作台
前面四款工具之外,还有一条值得单独看的路线:不做覆盖所有学科的通用工作台,而是把资源聚焦到一个领域。
斯坦福团队开发的 Biomni 就属于这一类。它面向生物医学研究,论文《Autonomous biomedical research with an artificial intelligence agent》已于 2026 年 7 月 9 日在 Science 在线发表。
我没有把 Biomni 塞进前面的四款横评,由于比较口径不同。Open Science Desktop 和 Synthetic Sciences OpenScience 面向多个学科。EvoScientist 与 AutoResearchClaw 更关心自主科研机制。Biomni 则围绕生物医学任务搭建专业执行环境。
论文显示,团队从 bioRxiv 的 25 个生物医学子领域中各选取 100 篇近期论文,让智能体提取常用任务、工具、数据库和软件。人工核验后,Biomni-E1 集成了 150 个专业工具、105 个软件包和 59 个数据库。
Biomni-A1 接到问题后,会先检索相关资源,再制定步骤,并把步骤写成可执行代码。它不依赖预先写死的流程,因此可以把 Python、R、命令行软件和数据库查询组合起来。
这和“装了许多工具”仍有区别。工具只是材料,Biomni 更关键的设计是知道当前任务需要哪些资源,以及执行过程中怎样根据结果调整计划。
论文给出的案例覆盖可穿戴数据、单细胞多组学、实验方案设计、蛋白质稳定性优化和实验室仪器编排。对科研程序员来说,最有参考价值的是单细胞多组学和蛋白质优化两个案例。
单细胞多组学分析需要连续处理 RNA-seq、ATAC-seq、调控网络和细胞类型等环节。Biomni 能把多个软件和数据步骤串起来,并在运行出错后调整。蛋白质优化则要连接结构预测、稳定性评估、文献证据和候选突变筛选。这些任务都不是问答,真正的工作发生在代码、数据和专业工具之间。
Science 论文和实际案例让 Biomni 比单纯的功能清单多了一层证据,但这不代表它已经覆盖整个生物医学领域。论文也承认,评估任务只触及其中一部分,还有不少领域没有测试。
使用门槛同样不能忽略。官方仓库提供 Python 包和 Gradio 网页界面,但首次使用可能需要下载约 11GB 的数据文件。部分依赖存在冲突,开源版本与当前网页平台也有差异。
更重大的是,官方明确提醒:Biomni 会以完整系统权限执行大模型生成的代码,可以访问文件、网络和系统命令。处理真实科研数据时,应该放进隔离环境,不能直接对着重大目录运行。
所以,Biomni 适合已经明确属于生信、多组学、遗传学或分子生物学的任务。如果你的领域已经有这类专业智能体,它往往比从通用工作台里自己拼工具更省事。换到材料、物理或通用机器学习场景,前面四款仍更合适。
科研 AI 工具怎么选?先看你要把哪一段交给 AI
四款主体工具和 Biomni 这个领域参照看完,选择方法反而可以很简单。
你想要一个日常科研桌面
优先看 Open Science Desktop。
它把本地文件、Notebook、图表、报告和运行记录放在一起。对于常常用 Python 处理数据的科研程序员,这种工作方式最接近日常环境。
你习惯命令行,想让科研代理连续推进任务
可以看 Synthetic Sciences OpenScience。
它更像一个面向科研任务的命令行代理和浏览器工作区。开放、可改、模型选择多,但环境配置和代码安全也要自己负责。
你研究多智能体和长期记忆
EvoScientist 更对题。
它的价值聚焦在三个角色如何协作,以及成功和失败怎样进入跨任务记忆。把它当作架构参考,比把它当普通聊天软件更合适。
你想研究可审计的自主科研流程
看 AutoResearchClaw。
它把辩论、实验修复、结果登记、引用核验和人工检查放进同一条流程。要研究“AI 怎样从想法走到可检查的论文草稿”,它提供了比较完整的样本。
你做的是生物医学或生信分析
可以关注 Biomni。
它不追求覆盖所有学科,而是把生物医学工具、软件包和数据库聚焦到一个执行环境中。对于多组学、遗传学和分子生物学任务,这种专业化可能比通用工作台更省事。
你只想查文献或整理几份数据
这四款都可能太重。
文献检索工具、普通聊天 AI,或者一个能操作本地文件的编程代理,也许更快。科研工具的目标是减少麻烦。为了一个半小时的任务,花一天搭环境,很可能本末倒置。

科研 AI 工具选型决策树
我的选择标准:不看功能数量,看五件事
后来再遇到新的 Claude Science 开源替代,我会先问五个问题。
研究者在哪一步做决定?
如果系统从目标直接跑到论文,中间没有检查点,我不会把重大课题交给它。
数字从哪里来?
实验结果应当回到代码、数据、参数和运行记录。只给一篇语气肯定的报告,不够。
失败后来怎么办?
修改代码、重跑实验和更换假设是三件事。系统只会修语法错误,离自主科研还很远。
数据和模型请求去了哪里?
本地工作区、云端模型、本地模型是不同边界。敏感数据能否使用,要看完整的数据流向。
换一个课题还好用吗?
机器学习基准跑得好,不等于化学或生物课题也可靠。领域工具、数据来源和评价方法,缺一不可。
这五个问题,比“有多少个智能体”“装了多少 Skills”更接近科研工作的真实成本。
写在最后
回到开头:这四款 Claude Science 开源替代,到底哪款最好?
如果让我给普通科研用户一个起点,我会先看 Open Science Desktop。它离日常文件、Notebook 和数据分析最近,也最容易判断是否适合自己的工作习惯。
喜爱命令行,又想串起文献、代码和实验,可以看 Synthetic Sciences OpenScience。
EvoScientist 和 AutoResearchClaw 则更适合关注自主科研的人。前者研究经验怎样跨任务保留下来,后者研究一条自主流程怎样处理失败、约束数字并留下检查入口。
如果任务已经落在生物医学或生信领域,Biomni 代表了另一种选择:少追求一些跨学科覆盖,把专业工具、数据和执行流程做深。
我对这类工具的态度并不悲观,但也不会由于它能生成一篇论文,就把“完成研究”的印章盖上去。
科研真正难的部分,常常是提出哪个问题、接受哪份证据、何时否定自己的假设。这些判断暂时还得由研究者负责。AI 可以接手越来越多步骤,责任却不会跟着自动转走。
选工具时,先找自己最耗时间的那一段。是文献整理,是代码和数据,是实验反复失败,还是结果难以追溯?问题定准了,工具才有高低之分。
项目与论文地址
-
Open Science Desktop:https://github.com/ai4s-research/open-science
-
Synthetic Sciences OpenScience:https://github.com/synthetic-sciences/openscience
-
EvoScientist:https://github.com/EvoScientist/EvoScientist
-
EvoScientist 论文原文:
https://arxiv.org/abs/2603.08127 -
AutoResearchClaw:https://github.com/aiming-lab/AutoResearchClaw
-
AutoResearchClaw 论文原文:
https://arxiv.org/abs/2605.20025 -
Biomni:https://github.com/snap-stanford/Biomni
-
Biomni 论文原文:
https://www.science.org/doi/10.1126/science.adz4351
如果觉得有用,随手点个赞、在看、转发三连吧,也方便更多朋友看到。如果想第一时间收到推送,也可以给我个星标。
有什么好的想法或者意见,在评论区和我聊聊吧。






[db:评论]