传统机器学习在材料科学中高度依赖人工特征工程,研究者需手动从成分、工艺和微观结构中提取数值描述符,不仅耗时且严重依赖专家经验。设计空间高维或涉及动态工艺路径时,手工特征构建几乎不可行。摩擦作为一门由材料成分、接触条件、温度、湿度及润滑剂化学等多重因素非线性耦合的复杂现象,其性能预测与机理理解尤其依赖对海量文献知识的综合挖掘。然而,尽管近年来BERT、SciBERT等通用预训练语言模型在科学文本挖掘中展现出巨大潜力,摩擦学领域始终缺乏专用的领域适配模型,致使数十年来沉积在非结构化文献中的实验数据、材料配方和测试条件难以被高效提取和利用。
近日,中国科学院兰州化学物理研究所润滑材料全国重点实验室计算摩擦学课题组,基于Web of Science核心合集系统检索了摩擦学相关文献,共获取摩擦学科相关的197,661篇摘要(截止2026年3月)及101,673篇完整全文(截止2020年),构建了摩擦学科预训练语料。研究团队以MatSciBERT为初始权重,利用掩码语言建模(MLM)目标在该语料库上进行持续预训练,损失从1.65降至1.26,困惑度从约5.20下降至3.52,相对降低约32%,构建了摩擦学科垂域大模型TriboBERT。

图1.TriboBERT预训练和摩擦系数预测工作流。
为量化评估TriboBERT的语义表征能力,研究团队设计了三类具有代表性的诊断任务,并与通用领域模型(BERT、SciBERT、MatSciBERT)及传统机器学习方法进行对比。
润滑剂缩写-全称语义对齐方面,选取20种常见固体润滑剂、液体润滑剂及添加剂,计算缩写与全称的余弦相似度。结果显示,TriboBERT的Top‑1匹配准确率高达90%,且正确配对的相似度通常超过0.85,而其他模型的准确率仅为5%~10%,且错误配对得分较高。这表明TriboBERT成功学习到了摩擦学术语间的精准语义映射。

图2.代表固体润滑剂,液体润滑剂和添加剂的缩写和全称之间的余弦相似矩阵,使用TriboBERT, MatSciBERT, SciBERT和BERT。
无监督文献语义聚类方面,对197,661篇摘要提取[CLS]嵌入,经UMAP降维和HDBSCAN聚类,自动划分出“通用摩擦学”“涂层”“切削/磨削”“腐蚀”“人工关节”“眼摩擦学”“轴承”“钢材”“地质摩擦学”和“牙科摩擦学”等10个主题鲜明的研究子领域。聚类空间内医学相关簇、工程相关簇均呈现近邻分布,验证了TriboBERT能保留细粒度的语义关联。
类金刚石(DLC)薄膜摩擦系数(COF)预测方面,基于Sedlacek等公开的193条高质量DLC实验数据,将结构化记录转换为自然语言描述(分涂层、对磨表面、测试条件三组),分别经TriboBERT提取[CLS]嵌入后,通过轻量MLP回归器预测COF。通过严格的5折交叉验证,TriboBERT取得验证集R2=0.92±0.03、MAE=0.016±0.004,显著优于BERT(R2=0.90)、SciBERT(0.87)、MatSciBERT(0.88)以及传统机器学习模型(最优者SVR为R2=0.90、MAE=0.018)。尤为重要的是,TriboBERT完全基于原始文本输入,无需任何手工特征工程,而传统模型则依赖精心设计的硬度、粗糙度、速度、载荷等数值特征——这一优势充分体现了大语言模型在自动语义特征提取方面的潜力。

图3.TriboBERT, MatSciBERT, SciBERT和BERT对DLC摩擦系数预测结果。
TriboBERT被定位为摩擦学文本理解的复用型基础设施,而非特定任务的专用模型。研究者可通过特征提取、微调和语义检索三种模式灵活应用,用于命名实体识别、构效关系抽取、文献知识发现等多元场景。该预训练模型已公开于Hugging Face平台(https://hf-mirror.com/tianyakl4/TriboBERT),供全球科研人员免费下载使用。
相关工作以“TriboBERT: A Pre-Training Language Model Tailored for Tribology”为题发表在Tribology International (2027, 226, 112639)上,何文豪副研究员为第一作者,鲁志斌研究员为通讯作者。
该研究得到中国科学院战略性先导科技专项、国家自然科学基金、中国科学院西部之光基金及兰州化物所“十五五”重点培育项目的支持。






