用 OpenCode 检索文献和验证观点来辅助跨学科领域交流

最近和几位朋友聊到一个话题,涉及到生物电、膜电位和发育生物学的内容。这是一个我并不熟悉的领域,但讨论中出现了不少听起来很有道理但仔细一想又觉得不太对劲的说法。

面对这种情况,以往的做法是去 Google Scholar 搜几篇论文,挑着读一读,大概判断一下。但这次涉及的是一个比较活跃的研究方向,论文量很大,而且我不具备足够的领域背景来判断哪些说法靠谱、哪些是过度引申。

于是我试着用 OpenCode 来做这件事——搜论文、下全文、转成可读格式、然后逐篇核对内容。整个过程下来,感觉这个工作流值得记录一下。

起因:一场关于生物电的友好讨论

讨论的起因是 Michael Levin 的工作。这位学者在 Tufts University 研究生物电与形态发生的关系,在发育生物学和再生医学领域相当有影响力。

有一位朋友在讨论中说了这样一段话:

「细胞分化器官的时候,主要是靠生物电网络调节,细胞核遗传物质像是提供原材料的工厂。生物电网络是靠线粒体供能的。母系遗传物质参与了更多的工作。」

这段话听起来挺像那么回事,每个断言似乎都有点生物学常识做支撑。但如果你真的去读 Levin 的论文,会发现他把这些概念之间的关系讲得比这精细得多,而上面这段话里有几处明显的简化乃至错误。

问题在于,要反驳或者修正这种说法,你得拿出论文里的原文来。光凭「我觉得不对」是没用的,你得知道人家到底说了什么。

第一步:搜论文

我给 OpenCode 的第一条指令很简单:

搜索下载 Michael Levin 所有关于生物演化和膜电位的论文,到当前目录,转换成 markdown 文档,并且保存好对应的图片,然后总结整理每一篇文章的实验内容和结论等。

OpenCode 先通过 PubMed 的 API 搜索了 Levin 名下的相关论文。这一步有个小插曲:Levin M 这个名字在 PubMed 里太常见了,搜出来的结果混进了不少其他同名作者的文章——有搞头痛医学的、有搞太阳能的、还有搞蜱虫的。OpenCode 后来加了一层过滤,通过 Tufts 大学附属机构和生物电关键词来筛选,最终锁定了 33 篇近五年(2021–2026)的高相关论文。

这个过滤过程值得大家注意,用 AI 工具做文献检索,你不能完全放手让它自己跑。它会犯一些错误——比如不区分同名作者。但如果你告诉它如何去检查中间过程,及时让它自己进行反馈,它的效率确实比自己人工搜要高得多。

第二步:下载和转换

33 篇论文里,18 篇有开放获取的全文 PDF,另外 15 篇是付费期刊的,只能拿到摘要。

OpenCode 用了几个不同的开放获取源来下载 PDF:Europe PMC 的 ?pdf=render 接口最有效,Unpaywall 作为补充。下载失败的就保存摘要和 PubMed 链接,不硬来。

拿到 PDF 之后,用 PyMuPDF4LLM 转换成 Markdown。这个库对学术论文的转换效果还不错,表格和图注基本能保留,公式有时候会乱但至少能看出结构。同时用 PyMuPDF 提取了所有图片,按论文分目录存好。

18 篇全文总共提取了 293 张图片。有些论文图很多,比如那篇 Technological Approach to Mind Everywhere 有 56 张图,占了 63MB。

整个过程全自动,甚至不需要人工在旁边看输出确认没问题。如果手动做这件事——搜 33 篇论文、下载 18 个 PDF、逐个转换格式、提取图片——恐怕得花一整天。OpenCode 大概用了十几分钟。

第三步:逐篇总结

这一步是最有价值的。OpenCode 用了 6 个并行 agent,每个负责 3 篇全文论文,同时读取 Markdown 全文并生成结构化中文总结。

总结的格式是统一的:

  • 期刊和作者
  • 研究类型(综述/实验研究/计算模型/理论框架)
  • 核心问题(一句话)
  • 主要方法
  • 关键发现和实验内容
  • 主要结论
  • 与膜电位和生物演化的关系

15 篇只有摘要的论文我也让它做了总结,但标注了「基于摘要」和「待获取全文后补充」。

最后还生成了一个总目录文档,包含所有 33 篇论文的目录表格、逐篇总结、以及一个核心主题交叉分析——把所有论文按膜电位编码、生物电与演化、再生、癌症、衰老、认知胶水六个主题做了归纳。

这个交叉分析特别有用。单看一篇论文你可能只看到局部,但把 33 篇放在一起看,你就能发现 Levin 的整个研究体系是怎么拼起来的。

第四步:回到那个讨论

有了 33 篇论文的全文和总结,现在可以回到那位朋友的说法,逐句核对了。下面每一处引用都标注了英文原文和出处,方便感兴趣的朋友去查证。

第一句:「细胞分化器官的时候,主要是靠生物电网络调节」

Levin 确实论证了生物电网络在器官发生中具有指导性角色。比如他在 2026 年的 Mind Everywhere 里明确写道:

"the bioelectric pattern memories are instructive, not epiphenomenal" [1]

2021 年的方法学论文也提到:

"Embryogenesis, as well as regeneration, is increasingly recognized to be orchestrated by an interplay of transcriptional and bioelectric networks." [2]

注意他用的词是 interplay(相互作用),不是「主导」或「主要」。

但问题在于「主要」这个词。Levin 从来没有说生物电是「主要」的调节方式。他反复强调的是协同关系。在 2023 年的 Bioelectric networks: the cognitive glue 一文中,他写道:

"the bioelectrical control system works together with genetic information" [3]

他用的比喻是计算机的硬件和软件:

"While the genome encodes the hardware (the cellular affordances, such as ion channels), the actual outcome is the result of context- and experience-sensitive electrophysiological software that this hardware supports." [3]

两者缺一不可,不存在谁主导谁的问题。

而且 Levin 在 2023 年的 Darwin's agential materials 里说得更清楚:

"It is genetics in the sense that genomes specify the ion channels needed to form the circuit, but it is not genetics in the sense that the actual outcome is controlled by experience (in physiological and behavioral space, respectively)." [4]

这话本身就说明他认为有两个层面在工作,不是一个层面取代另一个。

第二句:「细胞核遗传物质像是提供原材料的工厂」

方向上接近 Levin 的硬件/软件框架,但「原材料工厂」这个比喻矮化了基因组的作用。

Levin 确实把基因组叫「硬件」。但他用的词不是「原材料」,而是 affordances——可供性/能力。上面引用的原文已经说得很明白了:基因组编码的是 "the cellular affordances, such as ion channels" [3]。这不是被动的原料,而是定义了系统能做什么的主动能力。

更关键的是,Levin 在 2023 年提出基因组包含两种信息:

"two kinds of genomic information: that which directly specifies phenotypes (e.g., sequence of protein enzymes, or structural genome) and that which specifies a problem-solving competency (second-order computational capacities)." [4]

如果基因组只是原材料工厂,那它只需要提供蛋白质就行了。但 Levin 认为基因组还编码了「如何使用这些蛋白质」的元信息——这远超原材料的范畴。

Levin 还特别指出,连病毒基因组都会专门腾出宝贵空间来编码离子通道基因:

"It is no surprise that viruses, whose genomes are under significant pressure to remain minimal and concise, devote some of that precious space to ion channel genes." [4]

这说明这些基因不是可有可无的「原材料」,而是被自然选择主动保留的核心组件。

还有一点:生物电网络的全部结构组件——所有离子通道、所有间隙连接蛋白(connexins)、所有 V-ATPase 亚基——都是核基因组编码的。没有核基因组,生物电网络的硬件根本不存在。说它只是「原材料工厂」,就好比说 CPU 的设计图纸只是「硅片的原材料供应商」——技术上沾点边,但严重低估了设计图纸的重要性。

第三句:「生物电网络是靠线粒体供能的」

基础生理学层面没大错。细胞维持膜电位确实需要 ATP,ATP 主要由线粒体产生。Na⁺/K⁺-ATPase、V-ATPase 这些离子泵都是耗能的。2025 年的综述也提到 "Na⁺ out and K⁺ in through Na⁺/K⁺ ATPase to counter the Donnan effect" [5]。

但在 Levin 的框架里,这个说法严重误导了因果关系。

首先,Levin 把线粒体视为生物电层级架构中的一层,不是外部供能者。2025 年的论文提到:

"from the subcellular membrane potentials of organelles such as lysosomes and mitochondria to the spatiotemporal patterns of multicellular potentials characteristic of development and regeneration." [6]

线粒体有自己的膜电位,是生物电系统的一部分,不是站在外面给系统供电的电池。

其次,在 2024 年的会议报告里,Levin 团队提到 Duan 的工作发现线粒体生物电信号与细胞可塑性的耦合关系后,明确说:

"This relation between bioelectricity and mitochondria is a completely unexplored area." [7]

也就是说,Levin 自己都觉得线粒体和生物电网络的关系还没搞清楚,不会下「生物电靠线粒体供能」这样斩钉截铁的结论。

更重要的是,把生物电网络简化为「供能」问题,完全错过了 Levin 的核心论点。Levin 说生物电网络是信息处理系统——他称之为 "the cognitive medium of collective intelligence" [3]。Vmem 模式由离子通道和间隙连接的时空分布决定,不只是由 ATP 供应决定。Levin 自己在 2023 年就指出,用酵母的质子泵替换脊椎动物的 V-ATPase 仍然能工作,因为 "it produces the correct physiological signal" [4]——关键是电信号状态,不是具体的蛋白或能量来源。

这就好比说「大脑靠葡萄糖供能」——对,但这完全没说清大脑在做什么。

第四句:「母系遗传物质参与了更多的工作」

这一句在 Levin 的 33 篇论文里完全没有依据。

我把 33 篇全文都搜了一遍,没有找到任何将「母系遗传物质」与生物电网络调节建立因果关系的论述。"maternal" 这个词在论文里只出现在一个通道病条目和一个关于卵细胞提供环境缓冲的脚注里,都不是这个意思。

这句话的逻辑大概是这样的:线粒体是母系遗传的 → 生物电「靠线粒体供能」 → 所以母系遗传物质参与更多工作。

但即便接受前两步(虽然前面说了第二步就有问题),这个推理也是跳跃的。线粒体 DNA 只编码 13 个蛋白,主要是电子传递链组件。而生物电网络的全部结构组件——离子通道、间隙连接蛋白、离子泵——全部由核基因组编码,不是线粒体基因组。也就是说,生物电网络的硬件来自核基因组,不是母系遗传。

Levin 本人在 2023 年确实提到过 DNA 不是唯一的形态发生信息来源,但他举的例子是细胞骨架的皮质遗传(cortical inheritance),不是线粒体:

"DNA is not the only source of morphogenetic information. Changes made to unicellular form can persist across generations." [4]

而他明确将基因组 DNA 定位为「演化尺度个体的记忆印痕」:

"If we consider genomic DNA to be the engram of the evolutionary-scale individual." [8]

这里说的是核基因组 DNA,不是线粒体 DNA。

线粒体提供 ATP,ATP 是通用能量货币,谁都能用。但 ATP 的生成由线粒体执行,ATP 的使用(驱动离子泵、维持 Vmem)由核基因组编码的蛋白质完成。这就像说「发电厂是市政府建的,所以市政府参与了更多家用电器的工作」——发电厂提供电,但电器的设计、制造、控制全都是另一回事。

一些感受

这个案例或许有一些地方值得说。

首先就是,AI 工具确实能显著降低跨学科讨论的门槛。

以前如果讨论中遇到一个不熟悉的领域,要么得自己花大量时间补课,要么只能凭直觉判断——而直觉在不熟悉的领域里往往不可靠。现在有了 OpenCode 这类工具,你可以在十几分钟内把一个学者几十篇论文搜出来、转成可读格式、做好结构化总结。你不需要成为那个领域的专家,但至少能拿到第一手材料来做判断。

当然前提是你得用它来读原文,而不是让它直接给你一个「答案」。直接问 AI「这个人说得对不对」,它可能会根据训练数据里的信息给你一个笼统的回答,未必准确。但如果让它去读论文原文然后告诉你论文里怎么说的,准确度就高得多——因为这时候它做的是信息提取和整理,不是知识生成。

另外要注意,论文里的精确表述和二手转述之间的差距可以非常大。

Levin 在论文里说的是 "the physiological software of life" [9]、"an epigenetic mechanism that guides morphogenesis" [5]、"pattern memory" [3]、"nongenetic inheritance of a different large-scale anatomy" [1]。这些表述都有一个共同特点:明确区分了生物电和遗传物质,把它们定位为两个不同层面的东西。

但到了二手转述里,这些精细的区分就模糊了。「软件层」变成了「主要调节者」,「非遗传继承」变成了「母系遗传物质参与更多工作」。每一步简化都丢失了一些关键信息,累积下来就变成了一个和原文相去甚远的说法。

在日常讨论中,这自然不是谁故意歪曲的问题。人在转述复杂概念的时候,倾向于用自己能理解的框架去简化它。搞计算机的人容易把一切往「硬件/软件」上靠,搞生物学的人容易往「遗传/能量」上靠。但 Levin 的工作恰恰横跨这两个领域,用任何一个单一框架去简化它都会出问题。

但如果是有别有用心的营销号矩阵之类的,那就难说了。

最重要的是,讨论中拿论文原文来核对,比凭感觉争论有效得多。

如果你只是凭感觉说「你说的不太对」,对方也可以凭感觉说「我觉得就是这样」,讨论就陷入僵局。但如果你能说「Levin 在 2023 年的这篇论文里原文是 "works together with genetic information",用的是协同而不是主要」,讨论就稍微有了点共同的事实基础,虽然这种只言片语东鳞西爪的内容也不一定就能代表全貌。

当然,这也要求你自己得先去读那些原文,不能只看标题和摘要就下结论。摘要是一篇论文最浓缩的表述,但也是信息损失最大的部分。很多关键的限定词和上下文只在正文里才有。

然后是还是得人能想明白思路,工具再好,判断还是得你自己做。

事情还是得人先想好怎么做,像这个过程中,他的主要观点来源,他之前提到过是那个人,然后我才知道去搜这个人的相关文章,并且设置成最近的5年这样,避免拿一些过于老旧的文章来参与讨论当中。因为有的人可能5年之前的一些作品,他现在的观点和那时候未必一样。

不能说直接跟工具说:「有个人这么说了,你看看他说的对吗?」

这样的话就反而可能会让工具把幻觉掺入到其中,甚至有可能让工具去迎合你给的提示词,而不一定是基于一个现实的知识库进行更公正一些的审视和讨论。

工具提升的是效率,不是可靠性。可靠性还是得靠你自己对结果的审查。

最关键的是把论文内容和那位朋友的说法做对比分析——这步工具只能帮你提供材料,判断还是得你自己来。

工具和文件

用的工具组合是 OpenCode + PyMuPDF4LLM + PubMed/Europe PMC API。OpenCode 负责编排整个流程——搜索、下载、转换、总结——具体的技术操作由它调用各个工具来完成。

如果你也有类似的跨学科讨论需求,想快速了解一个不熟悉领域的研究者的核心观点,这个工作流可以照搬。核心步骤就是:搜论文 → 下全文 → 转格式 → 做总结 → 回到问题逐条核对。每一步都不复杂,但串起来的效率比手动操作高一个数量级。

讨论本身是好事。把观点摆出来,拿证据来核对,有错就改,没错的就坚持。这比闷着头各自相信各自的版本要好得多。只是在这个过程中,得确保你引用的证据确实是你读过的,而不是你觉得大概应该是那样的。

最后一道工序:引文核查

上面的全文写完之后,我又做了一件事:把参考文献列表里每一条引用,拿英文原文作为搜索词,回到转换好的文章全文里逐条搜索,确认这段话确实出现在那篇论文里。

这个过程听起来多余——既然引文是从论文里提取的,还能有错?但实际上,12 条引用查下来,原文全部命中,没有一条是编造的。

用 AI 工具做文献检索和整理,即便大部分操作是基于真实下载的 PDF 和 API 返回的结构化数据,而不是凭空生成,也仍然要警惕幻觉的影响。AI 工具在这个流程里扮演的角色更接近信息搬运工而不是知识生成器——它从论文里提取原文、从 API 获取元数据、从 PDF 转换格式。按理说每一步都有真实的数据来源,不应该出错。但事实是,数据源本身可能返回错误信息,AI 在整合这些信息时可能不加验证地照搬,最终输出里就混入了看起来合理实则错误的内容。

如果不做核查直接发出去,读者点链接会发现跳到了不相关的论文,整篇文章的可信度都会打折扣。更危险的场景是:如果 AI 在提取论文原文时也出现类似的「张冠李戴」——比如把 A 论文的结论安到 B 论文头上——那你基于这些引用做出的论证就全都站不住了。这次原文提取碰巧全部命中,但这个概率不能假设它每次都这么走运。

所以最后这一步引文核查,不是可有可无的仪式,是必须做的收尾工序。

工具提升效率,但工具不保证正确。

效率越高,出错的传播速度也越快——你十分钟生成的内容,如果带着错误发出去,也是十分钟就传播出去了。

在效率和可靠之间,核查这一步是唯一的缓冲。

其实整个这篇文章所说的也正是一个核查的过程,就是把观点和所声称依赖的文献来源进行一下核查。

参考文献

[1] Levin M, Resnik DB. "Mind Everywhere: A Framework for Conceptualizing Goal-Directedness in Biology and Other Domains—Part One." Biological Theory, 2026. PMID: 42183019. DOI: 10.1007/s13752-025-00523-6 https://doi.org/10.1007/s13752-025-00523-6

[2] Nanos V, Levin M. "Rewiring Endogenous Bioelectric Circuits in the Xenopus laevis Embryo Model." Methods in Molecular Biology, 2021. PMID: 33340356. DOI: 10.1007/978-1-0716-1174-6_7 https://doi.org/10.1007/978-1-0716-1174-6_7

[3] Levin M. "Bioelectric networks: the cognitive glue enabling evolutionary scaling from physiology to mind." Animal Cognition, 2023. PMID: 37204591. DOI: 10.1007/s10071-023-01780-3 https://doi.org/10.1007/s10071-023-01780-3

[4] Levin M. "Darwin's agential materials: evolutionary implications of multiscale competency in developmental biology." Cellular and Molecular Life Sciences, 2023. PMID: 37156924. DOI: 10.1007/s00018-023-04790-z https://doi.org/10.1007/s00018-023-04790-z

[5] Zhang G, Levin M. "Bioelectricity is a universal multifaced signaling cue in living organisms." Molecular Biology of the Cell, 2025. PMID: 39873662. DOI: 10.1091/mbc.E23-08-0312 https://doi.org/10.1091/mbc.E23-08-0312

[6] Cervera J, Levin M, Mafe S. "Top-down perspectives on cell membrane potential and protein transcription." Scientific Reports, 2025. PMID: 41372487. DOI: 10.1038/s41598-025-31696-6 https://doi.org/10.1038/s41598-025-31696-6

[7] Pai VP, Zhang G, Levin M. "'Bioelectricity in Development, Regeneration, and Cancers' Cell Bio 2023: A Joint Meeting..." Bioelectricity, 2024. PMID: 38525485. DOI: 10.1089/bioe.2024.0006 https://doi.org/10.1089/bioe.2024.0006

[8] Levin M. "Self-Improvising Memory: A Perspective on Memories as Agential, Dynamically Reinterpreting Cognitive Glue." Entropy, 2024. PMID: 38920491. DOI: 10.3390/e26060481 https://doi.org/10.3390/e26060481

[9] Pio-Lopez L, Levin M. "Aging as a loss of morphostatic information: A developmental bioelectricity perspective." Ageing Research Reviews, 2024. PMID: 38636560. DOI: 10.1016/j.arr.2024.102310 https://doi.org/10.1016/j.arr.2024.102310

[10] Pezzulo G, LaPalme J, Durant F, Levin M. "Bistability of somatic pattern memories: stochastic outcomes in bioelectric circuits underlying regeneration." Philosophical Transactions of the Royal Society B, 2021. PMID: 33550952. DOI: 10.1098/rstb.2019.0765 https://doi.org/10.1098/rstb.2019.0765

[11] Levin M. "Bioelectrical approaches to cancer as a problem of the scaling of the cellular self." Progress in Biophysics and Molecular Biology, 2021. PMID: 33961843. DOI: 10.1016/j.pbiomolbio.2021.04.007 https://doi.org/10.1016/j.pbiomolbio.2021.04.007

[12] Grodstein J, Levin M. "Stability and robustness properties of bioelectric networks: A computational approach." Biophysics Reviews, 2021. PMID: 38505634. DOI: 10.1063/5.0062442 https://doi.org/10.1063/5.0062442