近日,实验室与中国科学院深圳先进技术研究院、国防科技大学、华中科技大学、长沙学院等单位合作完成的研究论文“Self-Refining Spherical Consensus Embedding for Constrained Multi-View Clustering”在人工智能领域高水平期刊《IEEE Transactions on Pattern Analysis and Machine Intelligence》(IEEE TPAMI, IF 20.4)上发表,实验室成员王俊特聘副研究员为第一作者,实验室为第一完成单位。

随着数据采集技术的快速发展,同一对象通常可以由文本、图像、视频等多种形式进行描述,进而形成多视图数据。如何有效挖掘不同视图之间的一致性与互补性,是多视图学习领域的重要研究问题。现有约束多视图聚类方法大多在欧氏空间中学习特征表示,难以充分刻画高维数据的内在几何结构,并且容易受到约束稀缺、锚点质量和视图噪声的影响。
针对上述问题,研究团队提出基于球面投影去噪的共识嵌入框架SeSCE。该方法将多视图特征映射至球面空间,利用角度关系刻画样本间的语义关联,并通过成对约束增强类内紧凑性和类间可分性,从而提升高维表示的判别能力,降低模型对预定义锚点和聚类中心初始化的依赖。同时,研究团队进一步设计了基于置信度感知的伪约束挖掘机制,从高置信度预测中迭代提取可靠的样本关系,以缓解监督信息不足问题,并引入全局感知注意力机制,自适应融合不同视图,降低低质量视图和噪声的干扰。
该研究为有限监督条件下多源异构数据的表示学习与结构发现提供了新的技术路径,也可为多模态教育资源分析、学习者行为模式发现和复杂教育数据智能处理等研究提供理论方法参考。
论文链接:https://ieeexplore.ieee.org/document/11667288