蛋白质模型能够生成一串字母,药物研发人员则要判断,哪些序列值得进入下一轮实验。BioMap 试图经营的业务,就处在这两个步骤之间:让模型从广泛的生物学知识中学习,再将它用于合作伙伴的具体研究项目。
公司的公开资料从两个角度呈现了这一目标。2025 年 4 月发表的一篇论文介绍了其蛋白质模型,研究结果可供外界审视。2026 年 6 月与 Harbour BioMed(和铂医药)达成的协议,则提出设立一家公司,将 AI 工程能力与抗体平台、临床开发经验结合起来。[1][5] 将两份材料放在一起看,一个战略问题随之浮现:获取更优质的实验数据,能否转化为持久的模型优势?
在合作中发展起来的公司
BioMap 由 Robin Li 和 Wei Liu 于 2020 年创立。公司在 2023 年 10 月与 Sanofi(赛诺菲)发布的合作公告中,已经明确了双方分工:BioMap 贡献基础模型与计算技术,赛诺菲贡献专有数据和生物药开发经验。双方计划共同开发用于生物药设计与优化的 AI 模块。[3]
这份合作安排也区分了首付款与附条件的长期回报。BioMap 公布的条款包括 1000 万美元首付款,以及开发款项和附条件的里程碑付款。若相关条件达成,潜在交易总额可超过 10 亿美元。这一醒目的总额取决于未来成果,公告并未报告已经赚取 10 亿美元收入。[3]
赛诺菲自己的合作页面将持续合作的目标表述为蛋白质语言模型与多项性质的联合优化。[4] 这处表述有实际分量。研究合作方需要候选物同时满足多项要求,改善某一项预测性质,只完成了其中一部分任务。
BioMap 的机构布局也沿着合作关系展开。2024 年 6 月,香港科技园公司公布了 BioMap 进驻科学园、筹建国际创新中心的消息。xTrimoPGLM 背后的公开研究则将 BioMap 与清华大学、穆罕默德·本·扎耶德人工智能大学(MBZUAI)联系在一起。[1][6] 这家企业扎根于中国的 AI 产业,其科研与商业合作关系已跨越国界。
已发表的模型究竟带来了什么
2025 年 4 月 3 日发表于 Nature Methods 的论文介绍了 xTrimoPGLM:一个以 1 万亿 token 训练、拥有 1000 亿参数的模型。它的核心思路是将两项学习任务结合起来,即还原蛋白质序列中被遮蔽的部分,以及生成序列。用直白的语言说,同一个基础模型既学习读懂蛋白质的字母,也学习用这些字母书写。[1]
论文报告了模型在 18 项蛋白质理解基准上的评估结果,也介绍了进一步训练后的结构预测与定向生成表现。这些研究任务有各自明确的数据集和方法,结果支持的是一套可复用的计算基础。至于药物开发的总体成功率,这些评估尚无法给出答案。[1]
论文背后还有实际发布的模型。BioMap 与清华大学的代码仓库列出了 1000 亿参数模型的 4 比特版本,以及用于理解或生成任务的较小模型。仓库说明称,量化后的大模型可在配备 80 GB 显存的 A100/A800 GPU 上运行推理。这是该发布版本注明的硬件要求,合作方整个药物发现项目的实际成本仍须另行测算。[2]
仓库中的评估表进一步说明了这种区别。表中列出模型在两个测试集上的困惑度,即衡量模型对未参与训练的序列有多意外的指标。这两个测试集分别采用不同的序列相似度阈值,与训练数据隔开。测试检验的是模型能否学到可迁移的序列规律;生成的分子能否成为有用的药物,还需要其他证据。仓库同时注明了非商业许可证,模型公开可得与商业使用不受限制,是两个各自独立的问题。[2]
合作伙伴带来下一轮实验
和铂医药在 2026 年 6 月 15 日发布的交易所中文公告中,提出借助 MegaStream TechBio 将合作向前推进。和铂医药拟投入抗体平台、生物学专长和临床开发能力,BioMap 拟投入 AI 技术与模型工程能力。计划中的公司将把独家数据、专用模型,以及连接计算与实体实验的实验室流程结合起来。[5]
这是这组公司资料中最值得关注的变化。此前公开的模型给出了一个经过广泛训练的起点,拟议中的合资企业则增加了负责选择实验、推进候选物开发的组织。若这一安排奏效,模型输出就能持续接受实测结果的检验。
上一句是对公司战略的推断。公告披露的是一项计划,管理层任命仍在推进。公告还介绍了一个更新的、拥有 2680 亿参数的 xTrimo 系统。评估这一系统时,需要明确交代其版本、训练和评估与已发表的 1000 亿参数模型之间有何联系,后者的研究证据才有适用的依据。[5]
这项设想的吸引力不难理解。设想一个研究项目同时记录成功与失败的候选物,并采用一致的测量方法,模型便有望学会判断哪些提案值得优先测试。若不同批次的测量方法发生变化,失败实验的记录缺失,或数据无法跨项目复用,这套看似持续学习的流程中,可复用的知识就未必如合作措辞所暗示的那样丰富。这里列出的是商业设想成立的条件;关于 BioMap 内部实践的实际情况,上述分析并未作出认定。
哪些证据会改变判断
下一份有价值的披露,应当追踪一组由模型选出的候选物,记录它们走过一套明确实验流程的全过程。读者应能看到筛选时采用的比较基准、接受测试的候选物数量、它们满足了哪些要求,以及纳入实验结果后,下一轮表现是否改善。所用时间与实验次数,能让效率提升的主张变得清楚可核对。
对公司而言,合作方是否持续付费,回答的是另一个问题:系统创造的价值,是否足以让他们继续使用。模型基准成绩和潜在里程碑付款总额,都无法同时回答实验效果与持续商业价值这两个问题。
BioMap 已将其科学基础中颇有分量的一部分开放给外界审视。合作关系则指出了下一处差异化优势有望出现的地方。足以改变判断的进展,需要有记录可查:下一次实验决策有所改善,待实验室结果返回后,再下一次决策又有所改善。
资料来源
- Bo Chen 等,《xTrimoPGLM:用于解读蛋白质语言的统一千亿参数预训练 Transformer》,Nature Methods,2025 年 4 月 3 日——模型目标、训练规模、评估结果与作者所属机构。
- BioMap Research 与清华大学,xTrimoPGLM 代码仓库——已发布模型、量化推理要求、序列评估与许可证;访问日期:2026 年 9 月 26 日。
- BioMap,《BioMap 与赛诺菲建立战略合作,共同开发 AI 模块,加速生物药的药物发现》,2023 年 10 月 10 日——创立历史、合作双方的投入与附条件的付款安排。
- 赛诺菲,《技术平台》——赛诺菲对 BioMap 合作与多参数优化的说明;访问日期:2026 年 9 月 26 日。
- HBM Holdings,《与 BioMap 共同发起 MegaStream TechBio》,2026 年 6 月 15 日——香港交易所中文公告,介绍拟议中的合资企业、合作双方的职责与新版 xTrimo。
- 香港科技园公司,《香港科技园公司祝贺 BioMap 与香港投资管理有限公司签署战略合作协议》,2024 年 6 月 24 日——香港业务拓展、创新中心及照片来源。