热点
深度学习驱动点评闭环:UI测试创业路,reasoning_content:我们要求以UI测试工程师的口吻,写一个与技术、科技相关,关于[深度学习驱动点评闭环:创业成功的创新路径]的标题需要简短精炼,字数30字以内直接输出标题,不要加说明nn思考:UI测试工程师的口吻,可以突出测试、质量、用户体验等角度结合深度学习驱动点评闭环:创业成功的创新路径,核心是深度学习技术驱动用户点评的闭环,从而帮助创业成功可以写成类似UI测试视角:深度学习闭环驱动创业成功或深度学习点评闭环:UI测试工程师的技术创业路径等但要注意字数尝试几个:nn- 深度学习闭环,UI测试赋能创业成功(13字)n- UI测试工程师:深度学习驱动点评闭环创业(16字)n- 深度学习+点评闭环:UI测试的创业创新(15字)n- 用深度学习闭环点评,UI测试驱动创业(14字)n- UI测试视角:深度学习闭环点评创业路径(16字)nn最简洁且符合要求:可能需要包含深度学习驱动点评闭环这个核心短语例如:深度学习驱动点评闭环:UI测试创业路径(16字)或者更精炼:深度学习闭环点评,UI测试创业(12字)但少了驱动nn确保直接输出我选一个:深度学习驱动点评闭环:UI测试创业创新路径(17字)但创新路径有点重复或者:深度学习闭环点评:UI测试技术创业路(16字)最终输出一个
16 9 月 2026, 周三

继 GauGAN2 之后,英伟达推出了一个 GAN 的“超级缝合体”——PoE GAN。PoE GAN 可以接受多种模态的输入,文字描述、图像分割、草图、风格都可以转化为图片。
 
而且它可以同时接受以上几种输入模态的任意两种组合,这便是 PoE 的含义。
 
所谓 PoE 是 Hinton 在 2002 年提出的“专家乘积”(product of experts)概念,每个专家(单独模型)被定义为输入空间上的一个概率模型。
 
而每种单独的输入模态都是合成图像必须满足的约束条件,因此满足所有约束的一组图像是满足每个约束集合的交集。
 
 
假设每种约束的联合条件概率分布都服从高斯分布,就用单条件概率分布的乘积来表述交集的分布。
 
在此条件下,为了使乘积分布在一个区域具有高密度,每个单独的分布需要在该区域具有高密度,从而满足每个约束。而 PoE GAN 的重点是如何将每种输入混合在一起。
 
PoE GAN 的设计
PoE GAN 的生成器使用全局 PoE-Net 将不同类型输入的变化混合起来。
 
我们将每个模态输入编码为特征向量,然后使用 PoE 汇总到全局 PoE-Net 中。解码器不仅使用全局 PoE-Net 的输出,还直接连接分割和草图编码器,以此来输出图像。
 
全局 PoE-Net 的结构如下,这里使用一个潜在的特征矢量 z0 作为样本使用 PoE,然后由 MLP 处理以输出特征向量 w。
 
 
在鉴别器部分,作者提出了一种多模态投影鉴别器,将投影鉴别器推广到处理多个条件输入。与计算图像嵌入和条件嵌入之间单个内积的标准投影鉴别器不同,这里要计算每个输入模态的内积,并将其相加以获得最终损失。
 
 
随意变换输入的 GAN
PoE 可以在单模态输入、多模态输入甚至无输入时生成图片。
 
当使用单个输入模态进行测试时,PoE-GAN 的表现优于之前专门为该模态设计的 SOTA 方法。
 
例如在分割输入模态中,PoE-GAN 优于此前的 SPADE 和 OASIS。
 
 
在文本输入模态中,PoE-GAN 优于文本到图像模型 DF-GAN、DM-GAN+CL。
 
当以模式的任意子集为条件时,PoE-GAN 可以生成不同的输出图像。下面展示了 PoE-GAN 的随机样本,条件是两种模式(文本 + 分割、文本 + 草图、分割 + 草图)在景观图像数据集上。
 
 
PoE-GAN 甚至还能没有输入,此时 PoE-GAN 就会成为一个无条件的生成模型。以下是 PoE-GAN 无条件生成的样本。
 
 
团队介绍
论文通讯作者是英伟达著名工程师刘洺堉,他的研究重点是深度生成模型及其应用。英伟达 Canvas 和 GauGAN 等有趣的产品均出自他手。
 
论文一作是黄勋,北京航空航天大学本科毕业,康奈尔大学博士,现在在英伟达工作。
 
 

dawei

【声明】:毕节站长网内容转载自互联网,其相关言论仅代表作者个人观点绝非权威,不代表本站立场。如您发现内容存在版权问题,请提交相关链接至邮箱:bqsm@foxmail.com,我们将及时予以处理。

您错过了