国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:吕建成,叶庆,田煜鑫,韩军伟,吴枫
单位:吕建成,四川大学计算机学院, 四川 成都 61006511,叶庆,四川大学计算机学院, 四川 成都 61006502,田煜鑫,四川大学计算机学院, 四川 成都 61006503,韩军伟,西北工业大学 自动化学院, 陕西 西安 71012904,吴枫,中国科学技术大学 电子工程与信息科学系, 安徽 合肥 23002205
关键词:大规模深度神经网络;脑科学;多模态;通用人工智能;分布式计算
基金:国家重点研发计划(2017YFB1002201);国家杰出青年科学基金(61625204);国家自然科学基金(61836006)
大规模神经网络展现出强大的端到端表示能力和非线性函数的无限逼近能力,在多个领域表现出优异的性能,成为一个重要的发展方向.如自然语言处理(NLP)模型GPT,经过几年的发展,目前拥有1 750亿网络参数,在多个NLP基准上到达最先进性能.然而,按照现有的神经网络组织方式,目前的大规模神经网络难以到达人脑生物神经网络连接的规模.同时,现有的大规模神经网络在多通道协同处理、知识存储和迁移、持续学习方面表现不佳.提出构建一种启发于人脑功能机制的大规模神经网络模型,该模型以脑区划分和脑区功能机制为启发,集成大量现有数据和预训练模型,借鉴脑功能分区来模块化构建大规模神经网络模型,并由脑功能机制提出相应的学习算法,根据场景输入和目标,自动构建神经网络通路,设计神经网络模型来获得输出.该神经网络模型关注输入到输出空间的关系构建,通过不断学习,提升模型的关系映射能力,目标在于让该模型具备多通道协同处理能力,实现知识存储和持续学习,向通用人工智能迈进.整个模型和所有数据、类脑功能区使用数据库系统进行管理,该系统了还集成了分布式神经网络训练算法,为实现超大规模神经网络的高效训练提供支撑.提出了一种迈向通用人工智能的思路,并在多个不同模态任务验证该模型的可行性.
来源:2022年第4期
《软件学报》期刊编辑部