清华大学与Insta360联手,让AI真正“看懂“360度全景世界 这项由清华大学、北航大学、武汉大学与Insta360 Research共同主导的研究以预印本形式于2026年7月9日发布论文编号为arXiv:2607.08765有兴趣深入了解的读者可以通过该编号查询完整论文。全景图简单来说就是你在手机里看到的那种可以360度旋转的沉浸式照片——上下左右都能看到就像你站在房间中央四面张望一样。近几年随着VR头显、虚拟旅游和数字孪生技术的普及人们对AI自动生成全景图的需求爆炸式增长。你只需要打一段文字比如一个落日余晖下的热带海滩AI就能给你生成一张360度的全景图可以直接放进VR眼镜里欣赏。然而这件事远比听起来复杂。现有的AI画图工具比如大家熟知的各种文生图模型本质上是为普通的平面照片设计的。当你把它们强行用于生成全景图时就好像用一把菜刀去雕刻精细的玉石工具本身不合适结果自然差强人意生成的图左右两侧对不上、边界像被人用橡皮擦了一样模糊、空间感完全扭曲更不用说在此基础上做什么修改某个区域的内容或把照片风格换成油画了。这支研究团队提出了一个名为Canvas360的框架试图从根本上解决这个问题。他们的核心思路是与其让AI死记硬背全景图长什么样不如先教会它全景世界的空间是怎么运作的——也就是说先学几何原理再学画图本领。一、全景图到底难在哪里要理解Canvas360解决了什么问题得先明白全景图和普通照片的本质区别。普通照片就像你透过一扇窗户看到的景色视角有限边界分明。而全景图是把你周围所有方向的景色强行压扁摊开成一张矩形图片——这种摊平方式在学术上叫做等矩形投影Equirectangular Projection简称ERP。这就带来了一个非常直观的问题地球仪上的格陵兰岛看起来和非洲一样大但实际上非洲比格陵兰岛大14倍。同样的道理在ERP全景图里靠近图片上下两端对应现实中的天空和地面的区域会被极度拉伸和扭曲而中间区域相对自然。AI模型如果没有专门学过这种越靠近顶端越扭曲的规律生成出来的全景图就会充满奇怪的变形和不协调。更棘手的是全景图是一个首尾相连的图像——图片的最左侧和最右侧在现实世界中其实是同一条线也就是你站在原地正前方和正后方的交界处。如果AI在生成图片时左边和右边的内容对不上缝合处就会出现一条明显的裂缝整张全景图就废了。除了生成质量研究团队还想解决另一个挑战不仅仅是从无到有生成一张全景图而是能对已有的全景图进行各种操作——把它的风格换成水彩画把其中某个物体抹掉或者把一张普通照片扩展成全景图。这些操作统称为上下文感知生成In-context Generation意思是AI在工作时要参考用户给出的图片或指令而不是凭空创作。目前市面上已经有一些专门的全景图编辑工具但它们要么只能做某一种操作比如只能扩图要么需要针对不同任务训练不同的AI模型效率极低。研究团队的目标是用一个统一的AI模型同时搞定风格迁移、图像修复、扩图和编辑四大任务。二、两阶段学习法先学几何再学技艺Canvas360的训练过程分成两个阶段就像培养一名画家第一阶段先教他透视学和解剖学也就是几何原理第二阶段再教他各种绘画风格和技法。第一阶段叫做几何感知预训练。研究团队收集了10万张高质量的全景RGB照片并为每张照片配上了对应的深度图。深度图是一种特殊的图像它不记录颜色只记录场景中每个位置距离相机的远近——越近的地方颜色越浅或越深取决于配色方案越远的地方颜色越深或越浅。你可以把深度图理解为场景的地形等高线图只不过描述的是距离而非海拔。为什么要用深度图因为深度信息直接告诉AI哪里是前景、哪里是背景、空间如何分布这正是AI在生成和编辑全景图时最容易搞错的地方。普通的平面图AI模型在学深度时用的是从相机正前方拍摄的笛卡尔坐标深度而全景图的深度应该用球面坐标来表示也就是物体距离球心相机所在位置的距离。这个区别虽然听起来像数学细节但对于全景图的空间感来说至关重要。研究团队借助一个叫做DAP的先进深度估计工具专门针对全景图设计把这10万张照片都配上了准确的深度信息。训练时AI要同时生成RGB全景图和对应的深度图两者一起学习互相约束就像同时练左右手让两只手协调配合。第三个核心设计叫做速度循环填充Velocity Circular Padding。前面提到全景图的左右两侧其实是现实中的同一条线。早期的一些方法会简单地把图片的右边复制一份贴到左边或反过来让AI在训练时反复看到边界区域以为增加训练次数就能解决边界不连续的问题。但研究团队发现这种做法只是在增加边界区域的作业量并没有让AI真正明白左右两侧是相邻的。他们的新方法不仅让边界两侧的图像内容互相参考还让AI在预测图像变化趋势时也同步考虑边界的连续性——就像告诉画家你在纸的最右边画的这条线要和最左边的线接上而不是你多练几次画右边的线。第四个设计叫做相似度损失正则化Similarity Loss Regularization。在同时训练RGB图像和深度图时研究团队发现AI有时候会偷懒把两张图画得几乎一模一样导致深度图失去了它本应有的独特性。为此他们加入了一个惩罚机制如果AI预测出的RGB变化趋势和深度变化趋势太过相似就扣分。这就像考试时告诉学生数学答案和语文答案不能雷同逼着AI真正分别思考两个不同的任务。三、百万规模数据集四大任务一网打尽好的模型需要好的训练数据而全景图领域的数据一直是老大难问题。研究团队为此专门构建了一个叫做Canvas360Dataset的数据集规模达到惊人的100万样本覆盖四种上下文感知生成任务。这100万样本的基础是一个10万张全景图的种子集其中1万张来自著名的Matterport3D室内数据集另外9万张是研究团队从互联网收集或使用先进生成模型生成的高质量全景图。在这10万张图的基础上他们建立了一条自动化的数据生产流水线生成了90万张针对四种下游任务的配对训练数据。风格迁移数据的生产最为直接。研究团队使用FLUX.2-dev这款顶尖的图像生成模型按照12种不同的风格比如铅笔素描、油画、波普艺术等将原始全景图进行风格转换产生了20万对原图-风格图配对样本。为了保证质量他们还对原图和风格图提取线稿比较结构是否一致删除结构差异过大的样本。扩图数据的生成则利用了全景图本身的特性。研究团队随机模拟相机参数包括朝向角度、俯仰角度、视角宽度、图像高宽在全景图上截取一个对应的普通视角照片区域然后把这个区域之外的部分遮黑就形成了用一张普通照片扩展成全景图的训练对。这样生成了25万对扩图样本涵盖各种角度和视野范围的情况。图像修复数据参考了学术界经典的做法在全景图上随机生成矩形遮挡区域让AI学习把遮住的部分补全。研究团队还设计了两种不同的提示词模式一种是描述整张全景图的全局提示词另一种是专门描述被遮住区域内容的局部提示词。全局提示词配合大面积遮挡局部提示词配合小面积精细遮挡共产生了25万对修复样本。编辑数据的生成最为精细。研究团队使用视觉语言模型可以理解图像内容的AI和物体检测工具自动定位全景图中的各种物体然后用FLUX.2生成移除该物体后的图像。这样就得到了有物体的原图和移除物体后的图这一对样本。反过来这一对样本也可以用作添加物体任务的训练数据。对于小物体、复杂背景等难以处理的情况团队还引入了谷歌的NanoBanana工具进行精细修复。整个编辑数据集共生产了20万对样本。四、第二阶段微调一个模型搞定四项任务完成了第一阶段的几何原理学习之后Canvas360进入第二阶段把学到的空间感知能力迁移到实际的编辑任务上。在这个阶段深度图被抛开了。AI不再需要同时生成深度图而是专注于根据用户提供的输入图像和文字指令生成目标全景图。然而第一阶段建立的几何空间感知能力已经被刻进了模型的参数里成为一种隐性的先验知识在处理全景图的空间结构时自然而然地发挥作用。四种任务在技术上使用了统一的处理框架。无论是风格迁移把原图转换风格、图像修复补全被遮住的区域、扩图扩展视野范围还是编辑移除或添加物体AI都接收两类输入一张条件图对应任务的参考图比如待修复的有缺口的全景图以及一段文字描述。AI的任务是生成对应的目标图完整且符合要求的全景图。这种统一设计让一个AI模型就能处理原本需要四个不同专业模型才能完成的任务大大降低了部署成本也使得模型可以在四种任务之间共享知识互相借鉴。五、实验结果全景专项指标大幅领先研究团队在多个指标上与同类方法进行了全面对比竞争对手包括PanFusion、SMGD、PAR、WorldGen、LayerPano3D、HunyuanWorld和DiT360等当前最先进的全景图生成系统。评估指标本身也值得解释一番。FIDFréchet Inception Distance是衡量AI生成图像与真实图像整体分布差异的指标分数越低越好。但这个指标是用普通平面图像训练出来的对全景图的特殊性不够敏感。因此研究团队还额外使用了FAEDFréchet Auto-Encoder Distance这是专门为全景图设计的同类指标更能反映全景图质量的真实水平。此外还有IS多样性评分、CS文字与图像的匹配程度、以及几个感知质量评分。在Canvas360最看重的FAED指标上Canvas360以2.33分的成绩明显优于所有对手而第二名DiT360和HunyuanWorld均为2.91分。在感知多样性IS和美学评分QA aesthetic上Canvas360同样拿到了最高分。在边界连续性这一全景图特有挑战上研究团队通过专门的左右边界一致性指标LRCE-RGB进行测量Canvas360以0.0063的超低分数分数越低越好遥遥领先相比第二名DiT360的0.0101有接近40%的改善意味着左右边界几乎感觉不到接缝。在四个下游任务的表现上Canvas360同样全面领先。以图像修复为例Canvas360在感知相似度LPIPS、全景图特定保真度FAED和像素重建精度PSNR三个指标上均优于FLUX.1-Fill-dev、PAR和PanoDiffusion三个竞争对手。扩图任务的结果类似三项指标全面最优。编辑任务的对比更为全面Canvas360与FLUX.1-Kontext-dev、FLUX.2-dev、NanoBanana以及专门的全景编辑系统SE360和Omni2相比同样在三项指标上均排名第一。风格迁移任务的评估采用了三个维度内容保留度CP、风格相似度SR和整体视觉质量OV。Canvas360在内容保留度和整体视觉质量上排名第一风格相似度上略低于FLUX.2-dev但仍处于竞争力水平这说明Canvas360在忠实还原全景图空间结构的同时也能做到有效的风格转换而不是为了追求风格而破坏原始内容。六、人类评审员也买账用户研究结果定量指标的优势固然重要但最终判断图像好不好看的还是人类的眼睛。研究团队邀请了71名参与者进行盲评他们不知道每张图是哪个系统生成的从文字匹配度、边界连续性、全景感知度和整体质量四个维度进行评分。结果显示Canvas360在边界连续性、全景感知度和整体质量三个维度上均获得了最高的用户偏好比例分别为31.1%、34.1%和35.9%。在文字匹配度上Canvas360以26.2%排在第二第一是HunyuanWorld的26.9%差距极小。这些数据说明Canvas360不仅在机器评分上领先在真实人类用户的感知体验上也更受欢迎。七、拆解实验每个设计都有用吗为了验证每个创新设计的必要性研究团队进行了细致的消融实验也就是依次拆掉某个设计组件看看性能会下降多少。基础模型不加任何新设计直接在FLUX.1-dev上微调的FAED得分为5.37。加入深度图并行训练之后FAED降至4.74说明深度信息确实提供了有价值的几何引导。但与此同时视觉质量评分QAqua和QAae出现了下滑还偶尔出现图像过暗甚至接近纯黑的失败案例说明单纯加深度图会导致训练不稳定。加入位置偏移让RGB和深度的位置编码分开互不干扰之后QAae从3.41跳升到4.13证明两个通道的信息需要明确隔离不然AI会混淆它们的含义导致出现奇怪的视觉效果。再加入相似度损失正则化防止两个通道变得太相似之后QAqua和QAae进一步提升到4.71和4.20接近所有消融变体中的最优水平说明防止两个模态同质化对于生成清晰稳定的图像至关重要。速度循环填充的实验也很直观把全景图旋转180度之后这样原本在中间的边界就变成了明显可见的缝合线使用普通循环填充的版本仍然能看到一条清晰的接缝而使用速度循环填充的版本则几乎看不出来。八、还存在哪些不足研究团队在论文中坦承了Canvas360的局限性。目前训练数据在场景类型上存在不平衡某些类别的高质量全景数据较为稀缺。因此当遇到需要生成高分辨率人脸或者在严重扭曲的ERP区域比如天空和地面交界处显示文字招牌时Canvas360的表现相对较弱。这是因为人脸和文字对精细度要求极高而全景图的极端扭曲区域会把这些细节拉伸到难以辨认的程度现有的训练数据还不足以让模型完全掌握这类极端情况的处理方式。研究团队计划在未来继续扩充和平衡数据集专门针对这类难度较大的场景类型增加高质量训练样本以提升模型在罕见场景和严重几何畸变区域的鲁棒性。归根结底Canvas360做的事情是把教会AI理解球形空间的几何规律和让AI执行具体的全景图编辑任务这两件事分开来做先打好几何基础再学习应用技能。这种思路在普通平面图像领域其实早就被验证过但在全景图领域研究团队是第一次系统性地将其落地实施并配套建立了百万规模的专用数据集。这项工作对于VR内容创作者、游戏场景设计师、虚拟旅游开发者乃至普通用户使用全景相机拍摄照片后进行后期处理都有切实的应用价值。当然研究团队也提醒任何强大的图像生成技术都存在被滥用于虚假场景制造的风险他们建议使用者在敏感场景下配合水印标注、来源追踪等手段负责任地使用。有兴趣进一步了解技术细节的读者可以通过arXiv编号2607.08765查阅完整论文研究团队也在GitHub上开放了项目主页https://zry000.github.io/Canvas360/提供更多可视化结果。QAQ1Canvas360和普通AI绘图工具有什么本质区别ACanvas360专门为360度全景图设计它在训练时让AI同时学习色彩生成和空间深度信息从而理解全景图特有的球形空间几何规律。普通AI绘图工具只针对普通平面照片训练直接用于全景图会出现边界断裂、空间扭曲等明显问题。Canvas360还使用了速度循环填充技术让全景图左右两侧真正无缝衔接。Q2Canvas360Dataset数据集是怎么制作出来的A研究团队先收集了10万张高质量全景图作为基础然后通过自动化流水线生成90万张配对训练数据。风格迁移数据通过AI转换12种艺术风格产生扩图数据通过模拟随机相机角度截取并遮挡产生修复数据通过随机遮挡矩形区域产生编辑数据通过AI自动定位物体后移除再配对产生最终形成百万规模的专用数据集。Q3Canvas360在哪些实际场景中可以使用ACanvas360可以用于VR内容制作从文字生成沉浸式360度场景、全景图风格转换把真实照片转成油画或素描风格、全景图修复补全拍摄时被遮挡或缺失的区域、全景图扩展把手机普通照片扩展成360度全景以及全景图编辑移除或添加场景中的物体等多种应用场景。