全球虚拟细胞全景路线图发布!

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
全球虚拟细胞全景路线图发布!
8883点击    2026-08-24 09:26

全球虚拟细胞全景路线图发布!


8月18日,一篇系统梳理单细胞基础模型的综述预印本挂上 Preprints.org(doi:10.20944/preprints202608.1166.v1),标题是《The Landscape of Single-Cell Foundation Models: Design Principles, Applications, and Open Challenges》,尚未经过同行评审。


全球虚拟细胞全景路线图发布!


文章第一张图把 2022 年至今的模型按谱系排开。2022 年只有 scBERT、tGPT、Geneformer 这几个,到 2026 年已经分成三条粗线:只吃转录组或染色质开放数据的单模态模型;把细胞和自然语言绑在一起的语言增强模型;以及把转录组和扰动、空间、蛋白、表观拼在一起的多模态模型。四年时间,参数量从 25 万涨到 49 亿,预训练语料从 10 万个细胞涨到 3.6 亿个细胞。


全球虚拟细胞全景路线图发布!


综述认为,真正决定模型好坏的第一步不是架构,而是怎么把一个细胞"写成一句话"。目前有四种写法:把表达量分箱成离散标记(scGPT);直接用连续数值(scFoundation、CellFM);干脆不写数值,只按表达高低给基因排序(Geneformer);或者用码本把整个细胞压成几个隐标记(CellTok、RVQ-Alpha)。分箱抗噪但丢分辨率,连续值精确但对测序深度和平台敏感,排序稳健但放弃了绝对量,压缩省算力但丢掉了基因层面的可解释性。在这之上还有一层"加先验"的做法:用蛋白语言模型的嵌入初始化基因表示,把基因本体图或调控网络当作 token 之间的连线,或者直接用文献里的基因描述文本做嵌入。


全球虚拟细胞全景路线图发布!


骨架仍以 Transformer 为主,配合 FlashAttention、Performer 这类加速手段;同时出现了 Hyena 长卷积、Mamba 状态空间、Perceiver 隐瓶颈、图神经网络和扩散模型等替代路线,目标都是在基因数上万的情况下把序列算得起。下游适配则普遍转向 LoRA、QLoRA、scPEFT 这类只训练少量参数的方案。


全球虚拟细胞全景路线图发布!


Scaling 的证据是混合的。C2S-Scale、scTab、Stack、Geneformer-V2 都报告了随规模增长的收益;但零样本评测显示,更大的预训练数据未必带来更好的生物学表现,CellFM 的 8 亿参数版本微调后很强,在部分零样本注释任务上反而是小版本更好。一篇批评性报告干脆没有找到清晰的数据 scaling law。综述给出的判断是:在单细胞领域,语料的多样性比体量更重要——Geneformer 两代模型的最大增益都来自扩大预训练语料覆盖的生物学背景,而不是在同类样本里堆数量。


全球虚拟细胞全景路线图发布!


数据侧的重心正在从观察性图谱移向扰动图谱。Tahoe-100M 提供了 1 亿细胞的小分子响应,X-Atlas/Pisces 是 2560 万细胞、覆盖 16 种细胞背景的全基因组 CRISPRi Perturb-seq,人类细胞因子字典用 90 种细胞因子刺激了 970 万个 PBMC。原因很直接:只看快照数据,模型学到的是相关性;只有干预数据能告诉它因果。


全球虚拟细胞全景路线图发布!


应用部分列了几个已经走进湿实验室的例子。Geneformer 预测的 TEAD4 敲除损伤了心肌微组织的收缩功能,而敲除 GSN 和 PLN 挽救了 TTN 突变扩张型心肌病模型的收缩应力;GET 提出的 B 细胞特异 PAX5–NR2C2 调控关系被 BioID 实验支持;MaxToki 在人类衰老轨迹上找出的心脏促衰老因子,在人心肌细胞和小鼠体内都得到验证;SCimilarity 把纤维化相关巨噬细胞与一个体外 3D 水凝胶培养体系联系起来,随后被重建验证;C2S-Scale 在双背景筛选中提名了 silmitasertib 作为干扰素条件下的抗原呈递增强剂,并通过 HLA-A/B/C 上调得到确认。


全球虚拟细胞全景路线图发布!


不好看的部分同样写得很直白。多项基准显示,现有基础模型在扰动效应预测上并不能稳定超过简单线性基线,组合扰动的协同效应、跨细胞类型的泛化都还差得远。跨组织、跨物种、罕见细胞类型上的表现对训练分布高度敏感。评测本身也有问题:以对照为参照的皮尔逊相关会被系统性偏移掩盖,纠正后性能大幅下降;kBET、LISI、ARI 这些整合指标偏向批次混合和聚类分离,可能奖励了破坏连续细胞状态流形的模型。此外有工作证明,即使经过常规预处理,单细胞计数矩阵仍可能泄露个体私有属性。


作者们给出的方向包括:直接用计数分布建模而非归一化的连续替代量;用 PULSAR 这类分层结构把基因、细胞、多细胞系统串起来,做到 donor 层面的临床预测;把模型从静态编码器改造成能预测状态演化的"细胞世界模型";以扰动为中心重新设计预训练;以及把基础模型接进 AI agent(CellAgent、scPilot、CellVoyager、PantheonOS、Biomni)和 lab-in-the-loop 的闭环里,让模型提出扰动、实验回填数据、模型再更新。更远的目标写在最后:虚拟胚胎与数字人。


综述结尾的判断是,下一代模型不应只用常规基准来衡量,而要看它能否编码生物学先验、整合扰动与多模态数据、经受住分布外测试,并真正接上实验反馈。


文章来自于"BioTender 观测日志",作者 "Max"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
数字人

【开源免费】Fay开源数字人框架是一个AI数字人项目,该项目可以帮你实现“线上线下的数字人销售员”,

“一个人机交互的数字人助理”或者是一个一个可以自主决策、主动联系管理员的智能体数字人。

项目地址:https://github.com/xszyou/Fay

2
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner

5
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales