国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:李玘芮,励雪巍,赵奇,李杰,李玺
单位:李玘芮,浙江大学 计算机科学与技术学院, 浙江 杭州 31001311,励雪巍,上海电机学院 电子信息学院, 上海 20130602,赵奇,浙江大学 计算机科学与技术学院, 浙江 杭州 31001303,李杰,浙江大学 计算机科学与技术学院, 浙江 杭州 31001304,李玺,浙江大学 计算机科学与技术学院, 浙江 杭州 31001305
关键词:姿态控制生成;人物图像视频生成;生成对抗网络;扩散模型;可控生成
生成技术的飞速发展揭示了相关技术在实际应用中的潜力, 姿态控制人物图像视频生成技术(pose-guided person image and video generation)的核心目标是将输入信息的人物转换为指定姿态, 同时保持人物外观的高度一致性. 该技术可以广泛应用于虚拟试穿与时尚行业、广告内容生成领域的视频生成与编辑以及多模态结合生成等多个应用场景, 推动用户体验和技术创新的进步. 尽管该技术已经取得了显著进展, 仍面临着多个挑战, 包括姿态迁移过程中外观信息的有效提取和重排、不可见信息的生成、一致性保持、模型的高效训练与使用等. 基于现有技术的挑战, 详细分析了当前主流的姿态控制生成方法应对挑战的策略, 并探讨了它们在实际应用中的可行性和局限性. 同时, 还讨论了姿态控制生成技术的常用生成模型以及不同的姿态信息表示方法. 此外, 整理讨论了该技术常用的数据集大小、特点等信息、各项测试基准, 并从虚拟试穿、视频生成与编辑、多模态结合生成等应用场景展开了讨论. 此外, 还揭示了目前方法仍遇到的个性化信息的保留、复杂场景的生成以及模型效率与实时性能等挑战, 并讨论姿态控制生成技术可能的未来发展趋势, 旨在为相关领域的研究人员提供系统的总结与参考, 以期推动该技术在各行业中的应用与创新.
来源:2026年第5期
《软件学报》期刊编辑部