绿色视野 · 今日封面
OpenAI的两大模型:DALL·E与CLIP在文本到图像生成领域的应用解析
根据公开资料,OpenAI推出了两个跨越文本与图像维度的模型:DALL·E和CLIP。DALL·E是一个具有120亿参数的Transformer语言模型,用于生成图像;而CLIP全称是Contrastive Language-Image Pre-training,它是一个对比文本-图像预训练模型。文章梳理了这两个模型的关键技术细节及其在不同任务上的表现。