院况简介
1949年,伴随着新中国的诞生,中国科学院成立。
作为国家在科学技术方面的最高学术机构和全国自然科学与高新技术的综合研究与发展中心,建院以来,中国科学院时刻牢记使命,与科学共进,与祖国同行,以国家富强、人民幸福为己任,人才辈出,硕果累累,为我国科技进步、经济社会发展和国家安全做出了不可替代的重要贡献。 更多简介 +
院领导集体
创新单元
科技奖励
科技期刊
工作动态/ 更多
中国科学院学部
中国科学院院部
语音播报
多模态预训练模型被广泛认为是从限定领域的弱AI迈向通用AI路径的探索。
会上,徐波展示了自动化所打造的虚拟人“小初”,并演示通用多模态大模型的人机对话,展示了不同模态间的互相转换和生成实例,涵盖视频描述、智能问答、图像检索等多个功能。对该成果的演示证明,通过图—文—音三模态的关联与协同,可以有效地提升机器的理解和生成能力。
据介绍,依托面向超大规模的高效分布式训练框架,自动化所构建了具有业界领先性能的中文预训练模型、语音预训练模型、视觉预训练模型,并开拓性地通过跨模态语义关联实现了视觉—文本—语音三模态统一表示,构建了三模态预训练大模型,赋予跨模态通用AI平台多种核心能力。这也使得“紫东太初”兼具跨模态理解和生成能力。与单模态和图文两模态相比,其采用一个大模型就可以灵活支撑图—文—音全场景AI应用,具有在无监督情况下多任务联合学习并快速迁移到不同领域数据的强大能力。
引入语音模态后的多模态预训练模型,可实现共性图文音语义空间表征和利用,并突破性地直接实现三模态的统一表示。研发团队首次使 “以图生音”和“以音生图”成为现实,对更广泛、更多样的下游任务提供模型基础支撑,实现AI在视频配音、语音播报、标题摘要、海报创作等更多元场景的应用。
此外,自动化所研发团队还提出了弱关联三模态数据的语义统一表达,可同时支持三种或任两种模态弱关联数据进行预训练,有效降低了多模态数据收集与清洗成本。
© 1996 - 中国科学院 版权所有 京ICP备05002857号-1
京公网安备110402500047号 网站标识码bm48000002
地址:北京市西城区三里河路52号 邮编:100864
电话: 86 10 68597114(总机) 86 10 68597289(总值班室)
© 1996 - 中国科学院 版权所有 京ICP备05002857号-1
京公网安备110402500047号 网站标识码bm48000002
地址:北京市西城区三里河路52号 邮编:100864
电话: 86 10 68597114(总机) 86 10 68597289(总值班室)
© 1996 - 中国科学院 版权所有
京ICP备05002857号-1
京公网安备110402500047号
网站标识码bm48000002
地址:北京市西城区三里河路52号 邮编:100864
电话:86 10 68597114(总机)
86 10 68597289(总值班室)








