OpenAI展示了其跨越文本与图像维度的能力,推出了两个核心人工智能模型:DALL·E和CLIP。这些模型代表了当前生成式AI领域在多模态内容创作方面的重大进展。
从技术架构上看,DALL·E被描述为一个具有120亿参数的Transformer语言模型,其主要功能是根据文本指令来生成图像。而另一个关键组件是CLIP,全称是Contrastive Language-Image Pre-training,它是一个专门用于对比学习的文本-图像预训练模型。
在模型的训练数据和能力方面,OpenAI从互联网中收集了4亿个文本-图像对用于CLIP的预训练。DALL·E在生成图片时接收的是以单一数据流形式的tokens,具体包含256个文本tokens和1024个图像tokens,总计1280个tokens。
关于模型的性能表现,研究人员发现CLIP模型在识别常见物体方面表现良好。然而,当任务复杂度提高到计算图像中物品数量或预测图片中物品的位置距离等更抽象的层面时,“zero-shot” CLIP的表现仅略胜于随机分类的结果。尽管如此,CLIP在不直接针对基准进行优化的同时,展现出鲁棒性差距缩小了75%,其性能已达到与深度残差网络ResNet50相当的水平。
值得注意的是,OpenAI的研究人员观察到DALL·E具备一定的上下文推理能力。例如,研究人员发现DALL·E需要通过Transformer中的上下文推理才能得出“日出时,坐在田野上的水豚的绘画像”中水豚必然会有由于阳光照射产生阴影的结论。
在模型优化和应用方面,OpenAI的研究人员采用了对比目标(contrastive objective)和Vision Transformer两种算法来减少计算量。此外,CLIP模型在预训练了图像编码器和文本编码器之后,具备了将自身转换为zero-shot分类器的能力。然而,公开资料也指出,如果CLIP中添加的标签包括Fairface种族标签和少数负面名词,那么大约32.3%年龄为0至20岁的人像可能会被划分到负面类别中。
从技术背景来看,这些模型的出现标志着AI系统不再局限于单一模态的处理。DALL·E的图像生成能力与CLIP的跨模态理解能力相结合,极大地拓宽了AI在创意产业和内容创作领域的应用前景。这使得文本描述可以直接转化为具有物理合理性的视觉作品。
影响分析方面,这些模型的进步意味着未来AI工具将能更深入地理解人类语言背后的世界知识和物理规律,而不仅仅是进行像素级别的拼接或简单的概念匹配。例如,对阴影的推理能力,体现了模型从数据关联到逻辑推导的飞跃。
读者提示:对于关注AI伦理和偏见问题的用户,应留意CLIP模型在特定标签集下可能出现的分类偏差问题,这提醒我们在使用此类工具时必须保持审慎的态度。
信息来源
本文基于上述公开资料整理,未使用来源页面的图片、视频或嵌入媒体。