当我们走进任何一个3D设计工作室,都会看到设计师们专注地在电脑屏幕前工作。他们创造一个复杂的3D模型时,从来不会一下子就捏出整个物体,而是像搭积木一样,先做出头部再做身体,然后是四肢,最后把所有部分组装起来。这种化整为零的创作方式不仅让设计师能够精雕细琢每个细节,还能随时调整和修改单个部分。然而,当前的AI 3D生成技术却像是一个急于求成的学徒,总想一口气把整个3D物体生成出来。这种做法就像试图一笔画完整幅画一样,结果往往是整体看起来还行,但细节模糊不清。特别是当需要生成复杂物体时,比如一个穿着全套装备的消防员,AI经常会把头盔和头部融合在一起,或者把工具和身体搞混,产生一团模糊的东西。面对这个问题,香港科技大学的研究团队提出了一个颠覆性的解决方案:让AI也学会像人类设计师一样分部工作。他们开发了一个名为CoPart的系统,这个名字来自Contextual Part的缩写。
传统的AI 3D生成系统无论你要求它画什么,它都用同样粗的线条和同样的力度试图一笔完成。结果就是简单的物体还能凑合,复杂的物体变得面目全非。CoPart的核心创新在于彻底改变了这种一刀切式的思路。它把3D物体的创建过程分解成了多个独立但相互关联的部件生成任务。CoPart采用的是一种双重编码策略。当用户输入一段描述文字或者一张参考图片时,系统不会像其他模型那样尝试直接生成整个3D物体,而是先分析这个物体由哪些部件组成。每个部件都会有一个独立的生成通道,同时各个部件之间的相对位置和衔接关系会被另一个全局编码器精确维护。这种双轨道的工作方式确保每个部件都拥有独立的高精度表达,同时又不会出现错位或者比例失调的问题。举个例子,如果用户想生成一个机器人的3D模型,传统的AI方法可能把这个机器人当成一个整体来生成,导致手指粘连在身体上或者轮子嵌进了躯干里。CoPart的做法则是先判断这个机器人包含头部、躯干、手臂、腿部、轮子等部件,然后为每个部件分别生成精细的几何形状和纹理,最后再按照全局编码器确定的位置关系把这些部件组装在一起。最终生成的机器人模型每个部件都清晰可辨,而且可以独立编辑。
要让AI学会部件级3D生成,首先要解决的问题是:AI需要大量的部件级3D数据来学习物体是由什么部件组成以及这些部件之间是怎样的结构关系。为此,研究团队构建了一个名为PartVerse的大规模数据集,包含91000个3D部件的精细标注。PartVerse的数据标注过程本身就是一项艰苦的工程。研究团队从多个公开3D数据集中筛选了数千个高质量的3D物体模型,然后由专业的3D美术师逐个对每个物体进行部件分解和标注。每个物体被分解为多少个部件、每个部件的边界在哪里、部件与部件之间的连接方式是什么,这些信息都被精确地记录在数据集中。研究人员表示,PartVerse目前覆盖了家具、电子设备、交通工具、人物角色、动物等十几个常见类别,每个类别下又细分了数十种具体的物体类型。数据集中的物体平均被分解为8到15个部件,复杂的物体可能被分解为30个以上的部件。这种细致的部件分解标注为训练AI理解物体结构提供了基础数据。在PartVerse的支撑下,CoPart系统能够学习到不同类别物体的典型结构模式。比如椅子通常由椅背、座位和四条腿组成,汽车通常由车身、车轮、车窗和车灯组成。当用户要求生成一把椅子时,CoPart会自动按照学到的结构模式来分解生成任务。
CoPart的另一个技术创新是相互指导机制。部件级生成面临的一个核心挑战是:当多个部件独立生成时如何确保它们最终能够完美地拼合在一起。如果头部和身体的比例不匹配,或者手臂的长度和躯干的比例失调,组装出来的模型就会看起来很不协调。相互指导机制的工作原理是让每个部件在生成过程中参考其他部件的状态。具体来说,在生成躯干的时候系统会参考头部的尺寸来调整比例,在生成手臂的时候系统会参考躯干的宽度来确定长度。这种动态的相互参考机制让所有部件在独立生成的同时保持整体的一致性。研究团队通过实验验证了相互指导机制的有效性。在使用相互指导机制的情况下CoPart生成的所有部件之间的尺寸偏差平均降低了72%,拼接处的缝隙和错位平均减少了85%。相比之下传统的整体生成模型在处理复杂物体时最容易出现的问题是整体结构混乱,而CoPart通过分部生成加相互指导的方式,在复杂物体的生成上有明显的质量优势。在用户测试中,超过80%的参与者认为CoPart生成的复杂3D物体比传统方法生成的在部件清晰度和整体美观度上更加优秀。
CoPart分部生成的方式带来的一个额外的好处是用户可以对生成的3D模型进行部件级别的编辑。在传统的一体化3D生成模式下,用户如果对生成结果不满意,只能重新输入提示词重新生成一遍,无法针对特定部分进行修改。这导致用户经常要反复抽卡数十次才能得到一个满意的结果。有了CoPart,用户就可以在生成后的模型中选中某个部件直接进行修改。比如生成的机器人模型,用户觉得头部太大,可以只调整头部的参数,而不会影响其他部件的形状和位置。用户觉得手臂的姿势不合适,可以单独旋转手臂而不需要重新生成整个模型。这种部件级编辑的能力让3D生成从一次性指令变成了可迭代的创作过程,对于游戏开发和工业设计等需要精细控制的场景来说意义重大。研究团队还展示了CoPart在关节物体生成方面的能力。有些3D物体包含可动的部件,比如剪刀的刀刃和把手之间通过转轴连接,门的门板和门框之间通过铰链连接。CoPart能够识别和生成这些关节结构,生成带有正确关节类型的3D模型。这对于机器人仿真和动画制作等应用场景来说是一个重要的技术突破。