目的基于常规临床实验室检验数据,通过机器学习算法构建结直肠癌肝转移(CRLM)预测模型,并验证其预测价值。方法采用病例对照研究设计,纳入2019年1月至2023年8月山东大学齐鲁医院收治的5 026例结直肠癌患者,收集其临床信息及70项入院时实验室检测指标。经倾向评分匹配后,共纳入1 265例患者(非转移性结直肠癌患者1 012例,CRLM患者253例),按7∶3比例随机划分为训练集和验证集。通过组间差异比较、LASSO回归和多因素logistic逐步筛选预测变量。在训练集中,采用随机森林(RF)机器学习算法构建模型,采用受试者工作特征曲线下面积(AUC)、临床决策曲线(DCA)、校准曲线和Brier分数评价模型的性能,并在验证集中进行验证,采用Delong检验分析不同模型间的AUC差异;同时应用SHapley加性解释(SHAP)分析变量重要性。结果最终筛选出甲胎蛋白、癌胚抗原、糖类抗原19-9、腺苷脱氨酶、高密度脂蛋白胆固醇、乳酸脱氢酶、胱抑素C、谷氨酸脱氢酶、同型半胱氨酸、凝血酶原时间、淋巴细胞比率共11项指标训练RF预测模型;所构建RF模型的AUC(0.867)高于CEA(0.737)、CA19-9(0.738)及两项指标联合检测的AUC(0.786),Delong检验结果显示差异具有统计学意义(均
P<0.05)。SHAP分析表明,CA19-9、CEA和谷氨酸脱氢酶是预测CRLM最重要的指标。
结论本研究建立的基于常规实验室指标的RF模型可用于预测结直肠癌肝转移,为制定个体化治疗方案提供依据。