基因融合这个概念第一次接触的人多半会觉得它离自己很远——听起来像是只有肿瘤基因组学或者罕见病研究里才会用到的冷门术语。但实际情况恰恰相反只要你做过RNA-seq数据分析、跑过融合基因检测流程、或者哪怕只是看过几份肿瘤患者的临床报告你大概率已经和它打过照面了只是当时没意识到那个EML4-ALK或者BCR-ABL背后到底意味着什么。这篇内容我想把基因融合这件事从头到尾讲清楚——它到底是什么、怎么产生的、为什么值得关注、以及目前主流的鉴定方法各自适合什么场景。不管你是刚进实验室的研一学生还是已经跑过几十个样本但一直没系统梳理过融合检测逻辑的生信工程师希望看完之后能对这条技术路线有一个完整的认知框架。1. 基因融合的本质两个独立基因的异常拼接1.1 从嵌合转录本说起基因融合gene fusion最朴素的定义是原本应该分别位于基因组不同位置的两个独立基因因为某种结构变异被拼接成了一个嵌合的基因序列。这个嵌合序列如果被转录就产生融合转录本如果被翻译就产生融合蛋白。关键在于融合这两个字——它不是简单的基因拷贝数变化也不是点突变而是两个基因的编码区域发生了物理上的重新连接。打个比方基因组就像一本排版好的书每个基因是书里的一个章节。正常情况下第一章讲的是A蛋白的合成指令第十五章讲的是B蛋白的合成指令各司其职。基因融合相当于把第一章的前半段和第十五章的后半段直接装订在了一起变成了一段全新的、书里原本不存在的文字。这段新文字翻译出来的蛋白质既不是A也不是B而是一个带有A的部分功能域和B的部分功能域的杂合体。这种杂合体在大多数情况下是有害的。原因很简单蛋白质的功能高度依赖其三维结构而三维结构又由氨基酸序列决定。两个不同来源的片段强行拼在一起很可能导致蛋白质折叠异常、功能失控、或者获得原本没有的活性。比如激酶基因如果被融合上了另一个基因的强启动子或者二聚化结构域就可能导致激酶持续激活不断向下游传递增殖信号——这正是许多肿瘤驱动融合的典型机制。1.2 融合基因与融合转录本、融合蛋白的区别这三个概念经常被混用但在技术层面需要区分清楚。融合基因指的是基因组DNA层面发生的结构变异即两个基因的DNA序列被连接在了一起。融合转录本指的是这个融合基因被转录后形成的mRNA序列。融合蛋白则是融合转录本被翻译后产生的蛋白质产物。为什么这个区分重要因为不同的鉴定方法检测的层面不同。DNA层面的检测如全基因组测序、靶向DNA panel直接找的是基因组断点RNA层面的检测如RNA-seq找的是融合转录本。两者之间并不是一一对应的关系——一个基因组层面的融合不一定能产生稳定的转录本可能被无义介导的降解机制清除而一个检测到的融合转录本也可能来自反式剪接等非基因组变异机制。所以在实际项目中你选择什么方法取决于你想回答什么问题。1.3 为什么基因融合值得单独拿出来讲基因融合在肿瘤精准医学中的地位非常特殊。它不像点突变那样零散分布在整个基因组中也不像拷贝数变异那样只是量的变化。融合往往是一个全有或全无的事件——一个肿瘤样本里要么有某个融合要么没有。这种二元性使它成为极好的分子标志物有就是有没有就是没有判读门槛相对清晰。更重要的是许多融合基因直接对应可靶向的药物。ALK融合的非小细胞肺癌患者可以用ALK抑制剂ROS1融合对应ROS1抑制剂NTRK融合对应广谱TRK抑制剂。这些融合的检测结果直接决定患者能不能用某个药、用哪个药。这就是为什么融合检测在临床分子病理中占据了一个不可替代的位置。2. 融合是怎么产生的从染色体断裂到异常重接2.1 染色体易位最经典的融合来源染色体易位是基因融合最常见的产生机制。简单说就是两条非同源染色体各断了一次然后断片互换位置重新连接。如果断点恰好落在两个基因的内部就可能形成融合基因。慢性粒细胞白血病中的BCR-ABL融合就是9号染色体和22号染色体易位的结果也就是著名的费城染色体。易位的断点位置决定了融合转录本的具体结构。以BCR-ABL为例BCR基因的断点可以发生在不同的外显子之间产生不同长度的BCR-ABL融合蛋白p190、p210、p230对应的临床表型和疾病类型也不同。这说明融合的精确断点信息在临床解读中是有意义的不是随便检测到有融合就够了。2.2 染色体缺失与倒位被低估的融合制造者除了易位染色体内部的缺失和倒位同样可以产生融合。缺失是指染色体上的一段序列丢失如果丢失的断点跨越了两个基因剩下的两端重新连接就可能形成融合。倒位是指染色体的一段序列方向颠倒了180度如果断点落在基因内部倒位后也可能产生融合转录本。在非小细胞肺癌中EML4-ALK融合大多数是通过2号染色体短臂内部的倒位产生的而不是经典的染色体易位。这一点在设计检测方案时很关键如果你只关注易位信号可能会漏掉倒位产生的融合。所以基于DNA的融合检测方法需要能够覆盖各种结构变异类型不能只针对易位设计。2.3 串联重复与复杂重排融合的非典型路径除了上述两种基因融合还可以通过串联重复tandem duplication和更复杂的基因组重排产生。串联重复是指一段基因组序列连续复制了多次如果复制过程中断点落在基因内部就可能产生融合。复杂重排则涉及三个或更多断点的重接事件在肿瘤基因组中其实相当常见只是检测和解读的难度更大。这里有一个实操中容易忽略的点复杂重排产生的融合有时在RNA层面表现为看似正常的融合转录本但其基因组层面的结构可能非常复杂。如果你只用RNA-seq检测融合可能会漏掉那些虽然产生了融合转录本但表达量极低的情况如果你只用DNA panel检测又可能漏掉那些基因组断点落在panel覆盖范围之外的融合。这就是为什么在重要样本中RNA和DNA方法有时需要互补使用。2.4 融合产生的后果从功能获得到功能丧失融合产生的功能后果可以分为几类。第一类是激酶激活型融合导致激酶结构域被组成性激活这是最常见的致癌机制。第二类是转录因子失调型融合改变了转录因子的表达或功能比如在肉瘤中常见的EWSR1-FLI1融合。第三类是功能丧失型融合导致某个抑癌基因的功能被破坏。理解融合的功能后果对于解读检测结果至关重要。不是所有检测到的融合都有临床意义——有些融合是乘客事件不驱动肿瘤发生有些融合虽然存在但表达量极低可能没有实际功能影响。在报告中如何区分驱动融合和乘客融合是融合检测中最考验经验的部分。3. 融合鉴定的主流方法各自的适用边界3.1 荧光原位杂交FISH临床金标准FISH是检测基因融合的传统方法也是许多临床指南推荐的参考方法。它的原理是用荧光标记的探针与染色体上的特定序列杂交通过显微镜观察荧光信号的分布来判断是否存在融合。常用的策略是断裂分离探针在目标基因的两端各设计一个不同颜色的探针如果基因没有断裂两个信号靠在一起如果发生了断裂重排两个信号就会分开。FISH的优势在于它是单细胞水平的检测可以观察到肿瘤细胞的异质性而且对样本类型的要求相对宽松石蜡切片、穿刺样本都可以做。但它的局限性也很明显只能检测已知的融合伙伴通量低一次只能看一个基因对断点的精确位置不敏感只能判断断裂了但不能告诉你融合到了哪里结果判读有一定主观性不同操作者之间可能存在差异。实操提示FISH判读时通常以分离信号出现在≥10%-15%的肿瘤细胞中作为阳性阈值但具体阈值因实验室和检测目标而异。做FISH之前一定要确认好本实验室的阳性判读标准不要直接套用文献里的数字。3.2 逆转录PCRRT-PCR快速、灵敏但需要已知伙伴RT-PCR检测融合的思路很直接设计分别位于两个融合伙伴基因上的引物如果存在融合转录本就能扩增出特异性产物。它的灵敏度很高可以检测到低丰度的融合转录本而且速度快、成本低适合已知融合类型的快速筛查。但RT-PCR的局限在于它只能检测已知的融合伙伴和已知的断点区域。如果融合断点落在引物覆盖范围之外或者融合伙伴是之前没报道过的新基因RT-PCR就会漏检。另外RT-PCR检测的是RNA层面对RNA质量要求较高降解严重的样本可能出不了结果。3.3 RNA-seq高通量发现与检测的主力RNA-seq是目前融合检测中通量最高、信息量最大的方法。它可以同时检测所有基因的表达和融合情况不仅能发现已知融合还能发现新的融合伙伴。对于临床样本RNA-seq通常采用靶向捕获或全转录组测序两种策略。RNA-seq检测融合的核心挑战在于数据分析。你需要一个可靠的融合检测算法如STAR-Fusion、Arriba、FusionCatcher等还需要一套严格的过滤标准来区分真实融合和假阳性。假阳性的来源很多比对错误、重复序列、转录读通、模板切换等。一个经验丰富的分析人员会结合多个证据维度来判断——融合断点是否落在已知的功能域内、融合转录本的表达量是否足够高、是否在多个样本中重复出现、是否有对应的DNA层面证据支持。3.4 DNA panel从基因组层面确认融合基于DNA的靶向panel如FoundationOne、MSK-IMPACT等也可以检测融合原理是通过捕获内含子区域的探针来检测断点。DNA panel的优势在于它可以同时检测点突变、拷贝数变异和融合一管样本解决多个问题。而且DNA比RNA稳定对样本降解的耐受性更好。但DNA panel检测融合的灵敏度通常低于RNA方法因为融合断点往往落在内含子区域而内含子序列的捕获效率和分析复杂度都更高。另外DNA panel只能检测panel设计时覆盖的基因对于未知融合伙伴的发现能力有限。3.5 方法选择的核心逻辑方法检测层面通量已知/未知融合样本要求典型场景FISHDNA低仅已知宽松临床确诊、快速筛查RT-PCRRNA低-中仅已知RNA质量要求高已知融合的快速检测RNA-seqRNA高已知未知RNA质量要求高发现性研究、全面检测DNA panelDNA中-高已知为主宽松临床综合检测选择方法时核心要问自己三个问题第一我要检测的是已知融合还是可能发现新融合第二我的样本类型和质量适合哪种方法第三我需要的结果精度和周转时间是多少这三个问题的答案基本就决定了方法选择。4. 融合检测中的假阳性与假阴性那些踩过的坑4.1 为什么融合检测的假阳性率居高不下融合检测的假阳性问题比点突变检测严重得多。原因在于融合的本质是两个原本不在一起的序列被拼在了一起而测序和比对过程中有很多机制可以产生类似的信号。比如模板切换template switching在逆转录过程中逆转录酶可能从一条RNA模板跳到另一条上产生一个人工嵌合序列。再比如比对错误如果两个基因的某些区域序列相似比对软件可能把一条正常序列错误地拆分比对到两个基因上产生假融合信号。还有一个常见来源是转录读通transcriptional read-through两个相邻的基因如果共用转录终止信号可能产生一个包含两个基因序列的长转录本。这在基因组上相邻的基因中很常见但并不是真正的基因融合。区分读通和融合的关键在于读通产生的嵌合序列通常不包含典型的融合断点特征而且两个基因在基因组上的距离通常很近。4.2 假阴性的隐蔽来源假阴性同样值得警惕。一个融合明明存在但检测不到可能的原因包括融合转录本表达量太低低于检测灵敏度融合断点落在探针或引物覆盖范围之外融合转录本被无义介导的降解机制清除在RNA层面检测不到但DNA层面确实存在样本中肿瘤细胞比例太低融合信号被正常细胞的背景稀释。实操心得在做融合检测之前一定要评估样本的肿瘤细胞含量。如果肿瘤细胞比例低于20%RNA-seq检测融合的灵敏度会显著下降。这时候可能需要考虑显微切割富集肿瘤区域或者改用灵敏度更高的方法。4.3 如何建立可靠的过滤策略一个实用的融合过滤策略通常包含以下几个维度第一融合转录本的支持reads数是否足够通常要求至少3-5条跨越断点的reads第二融合断点是否落在基因的编码区域内第三融合是否导致阅读框改变如果是可能触发无义介导降解第四融合是否在正常样本数据库中出现如果正常样本中也有很可能是假阳性第五是否有DNA层面的验证证据。这些过滤条件不是绝对的需要根据具体项目调整。比如在发现性研究中你可能愿意放宽过滤条件以捕获更多候选融合然后通过实验验证来确认。而在临床检测中你更倾向于严格的过滤条件以确保报告的特异性。5. 从原始数据到临床报告融合分析的关键节点5.1 比对策略的选择融合检测的比对策略和常规表达量分析不同。常规RNA-seq分析通常使用STAR或HISAT2进行比对这些比对软件允许reads拆分比对到不同位置这对于发现融合至关重要。但拆分比对也带来了假阳性风险所以需要在后续分析中严格过滤。一个常见的做法是使用STAR的two-pass模式第一遍比对发现新的剪接位点第二遍比对将这些新位点纳入参考。这对于融合检测有帮助因为融合断点往往不在已知剪接位点数据库中。另外一些融合检测工具如Arriba会直接利用STAR的嵌合比对输出简化了分析流程。5.2 融合断点的精确定位知道有融合和知道融合的确切断点在哪里是两回事。精确的断点信息对于判断融合是否导致阅读框改变、是否保留关键功能域至关重要。在RNA-seq数据中断点定位的精度受测序读长和覆盖深度的影响。如果断点区域覆盖度不够可能只能定位到外显子级别无法精确到碱基。对于临床报告来说通常需要报告融合涉及的外显子信息如EML4第13号外显子与ALK第20号外显子融合而不是精确到碱基的断点。但在某些情况下比如断点恰好落在功能域边界附近精确断点信息就很重要了。5.3 融合表达量的定量融合转录本的表达量是判断其临床意义的重要参考。一个表达量极低的融合可能只是背景噪音而高表达的融合更可能是驱动事件。但融合表达量的定量并不简单你需要考虑融合转录本和野生型转录本的相对比例还要考虑测序深度和样本质量的影响。实际操作中常用的指标包括跨越断点的split reads数量、覆盖断点区域的spanning reads数量、以及融合转录本相对于野生型转录本的表达比例。这些指标需要结合起来看不能只看单一数字。5.4 报告解读中的常见陷阱在撰写融合检测报告时有几个常见的陷阱需要避免。第一不要把所有的融合都当作驱动事件报告——有些融合是乘客事件没有临床意义。第二注意区分融合的临床证据等级——有些融合有明确的用药指南支持有些只有个案报道。第三注意融合的亚型——同一个基因的不同融合亚型可能有不同的临床意义。经验之谈在报告中我通常会把融合分为三个等级有明确临床意义的如ALK融合、有潜在临床意义的如新发现的激酶融合、以及意义不明确的如功能未知的融合。这种分级方式可以帮助临床医生快速抓住重点。6. 融合检测的进阶话题与常见疑问6.1 融合检测在血液肿瘤和实体瘤中的差异血液肿瘤和实体瘤的融合检测策略有明显差异。血液肿瘤中的融合往往有明确的诊断和分型意义如AML中的PML-RARA、RUNX1-RUNX1T1检测方法以RT-PCR和FISH为主因为这些融合类型相对固定。而实体瘤中的融合类型更加多样RNA-seq和DNA panel的使用更为普遍。另外血液肿瘤样本通常可以获得高质量的RNA新鲜骨髓或外周血而实体瘤样本往往是石蜡包埋组织RNA降解严重。这直接影响方法选择石蜡样本做RNA-seq需要特别注意RNA的提取质量和建库策略。6.2 融合检测与免疫治疗的关系融合基因和免疫治疗之间的关系是近年来的一个热点。一方面融合基因产生的融合蛋白可能被免疫系统识别为新抗原理论上可能影响免疫治疗的效果。另一方面某些融合如NTRK融合的患者对免疫检查点抑制剂的反应可能与其他驱动基因阳性的患者不同。目前这个领域的数据还在积累中但有一点是明确的融合检测的结果不应该只用于靶向治疗决策也应该纳入免疫治疗的综合评估中。在临床实践中我见过一些融合阳性的患者对免疫治疗有很好的反应也见过反应不佳的这提示融合类型和肿瘤微环境的相互作用可能比我们目前理解的更复杂。6.3 融合检测的标准化进展融合检测的标准化是一个正在进行中的工作。不同实验室之间的检测方法、分析流程、判读标准都存在差异这给结果的可比性带来了挑战。近年来一些国际组织如ESP、AMP发布了融合检测的指南和推荐但落实到具体实验室还需要时间。对于做融合检测的实验室来说参加室间质评EQA是验证检测能力的重要手段。通过与其他实验室的结果比对可以发现自身流程中的问题。另外建立内部验证数据集也很重要——用已知融合状态的样本定期验证检测流程的稳定性。6.4 常见问题速查QRNA-seq检测到的融合需要DNA验证吗A取决于应用场景。在临床报告中如果融合有明确的用药意义通常建议用另一种方法如FISH或DNA panel验证。在发现性研究中如果融合是新发现的验证更是必须的。Q融合检测的灵敏度能达到多少A这取决于方法、样本质量和融合表达量。在理想条件下高质量RNA、高表达融合RNA-seq可以检测到肿瘤细胞比例低至5%-10%的样本中的融合。但实际灵敏度因情况而异不能一概而论。Q石蜡样本能做融合检测吗A可以但RNA质量是关键限制因素。建议使用专门为石蜡样本优化的RNA提取试剂盒并评估RNA的完整性如DV200值。如果RNA严重降解可能需要考虑DNA层面的检测方法。Q融合检测应该用新鲜样本还是冷冻样本A冷冻样本的RNA质量通常更好适合RNA-seq检测。但冷冻样本的获取和保存成本更高而且不是所有样本都能获得冷冻组织。石蜡样本虽然RNA质量差一些但更贴近临床实际。Q如何判断一个融合是否值得报告A综合考虑几个因素融合是否在已知的驱动基因中、融合是否导致阅读框改变、融合表达量是否足够高、是否有文献或数据库支持其临床意义。如果都不确定可以标注为意义不明确的融合建议进一步验证。融合检测这个领域还在快速发展中新的融合类型、新的检测方法、新的临床证据不断涌现。保持对新技术和新数据的敏感度同时坚守对检测质量的严格要求是我在这个领域工作多年最深的体会。
企业数字化 ERP 产品动态
相关推荐
交通流时序预测实战:从数据清洗到多模型对比部署 简介:这是一份面向计算机专业本科生的交通流量预测实战项目资源,适用于毕业设计、期末大作业及机器学习课程实践,聚焦Python环境下基于时序数据建模的智能交通分析场景。资源包含267个文件,主体为7个核心Python脚本(含… · 2026/9/23 23:24:50
药物协同作用预测实战:基于PyTorch的Transformer预训练模型微调指南 简介:基于PythonJupyter Notebook与Transformer预训练模型的抗癌药物协同作用预测项目包,覆盖数据预处理、模型构建与评估的完整流程,适用于高校毕业设计、课程设计或药物研发领域初学者进阶。资源共481个文件,其中450个CSV数据文… · 2026/9/23 23:24:44
停车场空位检测数据集:VOC+YOLO双格式7959张2类 简介:本资源是面向计算机视觉初学者与智能交通项目开发者的停车场空位检测专用数据集,适用于目标检测模型训练与算法验证。数据集包含7959张高质量停车场实景图像,标注2类目标(empty/occupied),共46.19万个… · 2026/9/24 0:06:22
可转债套利实战:六种方法详解与风险控制 可转债这个品种,这几年参与的人越来越多,但真正把它当"套利工具"而不是"打新彩票"来用的人,其实并不多。我身边不少朋友对可转债的理解还停留在"中签了赚一顿饭钱"的阶段,一提到套利,第… · 2026/9/24 0:06:22
昆虫识别与数目统计毕设实战:从CSV到ResNet迁移学习全流程解析 简介:一套完整的昆虫识别与数目统计毕业设计项目资源,面向大四学生及需要完成课设、大作业的开发者,提供从模型训练、目标检测到数量统计的闭环方案。压缩包共164个文件,大小14.59MB,内含23个Python脚本、97张JPG图片、… · 2026/9/24 0:06:22
通达信箱体主图与副图指标公式全解析:从设计思路到实战应用 很多年以前我刚接触通达信的时候,最痴迷的事情就是到处淘指标公式。那时候论坛里的大神们发帖都神神秘秘,动不动就是“国宝级源码”“副图之王”,下载下来一看,要么加密,要么乱码一堆,真正能看懂的没几个。… · 2026/9/24 0:06:09
QLab Pro实战:用Cue列表打造稳定精确的现场演出控制中枢 我入行做现场声音和多媒体控制这些年,设备换了一茬又一茬,但有一款软件始终待在我的骨干方案里,就是QLab Pro。它没有花哨的界面,也不是那种装上就能“自动帮你完成演出”的傻瓜工具,但它解决了一个现场工作者最头疼的… · 2026/9/24 0:06:09
swagger-codegen 模型文档解析:从 ArrayOfNumberOnly 看懂“纯数字数组“模型的定义、生成与使用 开发工具代码生成API设计 【免费下载链接】swagger-codegen swagger-codegen contains a template-driven engine to generate documentation, API clients and server stubs in different languages by parsing your OpenAPI / Swagger definition. 项目地址: http… · 2026/9/24 0:05:50
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44