GenEAva:卡通头像数据集
论文信息
- 标题:GenEAva: Generating Cartoon Avatars with Fine-Grained Facial Expressions from Realistic Diffusion-based Faces
- 作者:Hao Yu, Rupayan Mallick, Margrit Betke, Sarah Adel Bargal
- 单位:Boston University; Georgetown University
- 发表:IEEE FG 2025
- 开源:未开源(截至 2026.07 未找到官方仓库)
卡通头像在社交媒体、在线辅导、视频会议和游戏中的应用日益普及 #nowak2018avatars。然而,当我们想让一个卡通头像表达"同情"(compassion)或"嫉妒"(jealousy)这样的细粒度表情时,会发现一个尴尬的现实:现有卡通头像数据集要么没有表情标注,要么只有 happy/sad/angry 等粗略分类 #cartoonset。生成式 AI 虽然能轻松创建高质量真实人脸,但卡通头像的细粒度表情生成一直缺乏数据支撑。
更深层的问题还有两个。一是身份记忆风险:扩散模型可能复制训练数据中的真实人脸身份,引发隐私担忧 #somepalli2022diffusion #carlini_usenix。二是人口统计学偏差:现有卡通数据集(如 Manga109)偏向年轻、浅肤色角色 #fujimoto2016manga109,无法代表多元人群。
GenEAva #Yu-et-al.-2025 来自 Boston University 和 Georgetown University,针对上述三重困境提出了一个完整方案:微调 SDXL 扩散模型学习 135 种细粒度表情分布 → 用 GPT-4o 生成人口均衡的提示词 → 生成真实人脸 → DCTNet 风格化为卡通头像。最终产出 GenEAva 1.0 数据集——13,230 张卡通头像,覆盖 135 种表情,平衡性别和 7 个种族群体,并通过 ArcFace 定量分析和 AMT 用户研究双重验证了身份新颖性。
2.1 已有方法的三重瓶颈
面部表情生成经历了从 GAN 到扩散模型的演进 #choi2018stargan #ho2020denoising。StarGAN #Choi-et-al.-2018 开创了多域人脸编辑,但仅支持基本表情。Pikoulis et al. 用 CLIP 潜在引导微调 Stable Diffusion,将表情类别扩展到 7 种基本情绪。Liu et al. #Liu-et-al.-2024 虽然同样使用 135 类表情,但需要选择参考图像进行表情迁移(expression transfer),生成受限于参考图的多样性。
我们可以将已有方法面临的困境归纳为三个层面:
| 瓶颈 | 具体表现 | 影响 |
|---|---|---|
| 表情粒度不足 | 多数方法仅覆盖 6-7 种基本表情 #he2024synfer | 无法生成 compassion、jealousy 等复杂情绪 |
| 参考图依赖 | Liu et al. 需要选取参考图像做表情迁移 #Liu-et-al.-2024 | 表情多样性受限于数据集中参考图的覆盖 |
| 身份记忆风险 | 扩散模型被证实会复制训练数据 #somepalli2022diffusion | 生成人脸可能泄露真实身份,不适合公开数据集 |
2.2 GenEAva 的突破口:从"迁移"到"分布学习"
GenEAva 的核心 insight 可以用一个类比来理解:Liu et al. 的方法像是"给画师一张表情参考图让他临摹",而 GenEAva 则是"让画师系统学习 135 种表情的画法,然后凭理解直接画"。前者受限于参考图,后者可以从学习到的分布中自由采样。
具体来说,GenEAva 通过在 Emo135 #Chen-et-al.-2022 数据集上微调 SDXL #Podell-et-al.-2023,让模型直接学习 135 类表情的潜在分布。推理时只需文本提示(包含表情、种族、性别、年龄信息),即可从分布中采样生成全新的人脸图像——无需任何参考图像。这种"表情分布学习"范式使得表情生成不再受限于参考图像的可用性和多样性。
但这里有一个技术挑战:标准扩散模型的训练目标(噪声预测损失)对表情这一语义属性的约束是间接的。文本条件虽然包含表情信息,但对于 compassion 和 sympathy 这样微妙的表情差异,仅靠文本条件难以精确控制。GenEAva 的解决方案是引入表情引导损失——我们将在 Part 3 详细展开。
GenEAva 的完整管线分为两个阶段:微调阶段(让 SDXL 学会 135 类表情)和推理阶段(生成真实人脸 → 风格化为卡通头像)。图 1 展示了整体架构。
3.1 微调阶段:表情引导的扩散模型微调
微调阶段的核心问题是:如何让扩散模型不仅学会"去噪",还学会"画准表情"?GenEAva 的答案是双损失联合训练——标准扩散模型损失保证图像质量,表情损失保证表情准确性。
扩散模型损失(DM Loss)
SDXL 作为潜在扩散模型,在 VAE 编码后的潜空间中进行去噪训练。给定真实图像 $\mathbf{x}_0$ 经编码器 $\mathcal{E}$ 得到潜变量 $\mathbf{z}_0$,前向过程逐步添加高斯噪声,任意时间步 $t$ 的噪声潜变量可由闭合形式直接计算:
U-Net $\epsilon_\theta$ 接收噪声潜变量 $\mathbf{z}_t$、时间步 $t$ 和文本条件 $\tau(p)$,预测添加的噪声。DM 损失就是预测噪声与真实噪声之间的平方误差:
但仅靠 DM 损失,表情信息只能通过文本条件间接传入。对于 135 种细粒度表情(如 compassion vs sympathy),文本到表情的映射非常复杂,标准 DM 损失难以充分约束。
表情损失(Expression Loss)
GenEAva 引入了一个额外的表情损失,使用 POSTER #Zheng-et-al.-2023 作为表情编码器 $\mathcal{E}_{\text{exp}}$。POSTER 是一个基于 Transformer 的 SOTA 面部表情识别模型,能将面部表情编码为具有语义区分度的特征向量。
表情损失的核心思想很直观:让生成图像和真实图像在 POSTER 的表情特征空间中对齐:
但这里有一个工程难题:训练时无法直接获得生成图像 $\hat{\mathbf{x}}_0$(需要完整的多步去噪链,计算上不可行且无法反向传播)。GenEAva 采用了一个巧妙的解决方案——一步逆公式近似:
从闭合形式反解出 $\mathbf{z}_0$ 的近似值 $\hat{\mathbf{z}}_0$,再通过 VAE 解码器 $\mathcal{D}$ 转回像素空间得到 $\hat{\mathbf{x}}_0$。由于 $\epsilon_\theta$ 是模型参数的可微函数,整条梯度链 $\mathcal{L}_{\text{exp}} \to \hat{\mathbf{x}}_0 \to \hat{\mathbf{z}}_0 \to \epsilon_\theta$ 都可以反向传播。这意味着表情损失可以直接更新 U-Net 的参数,让模型在去噪的同时学习表情语义。
总训练目标是两个损失的等权组合($\alpha = 1.0$):
这里 $\alpha = 1.0$ 意味着 DM 损失和表情损失被赋予同等权重。论文未报告不同 $\alpha$ 值的消融实验,这是一个可复现性缺陷。
3.2 推理阶段:文本 → 真实人脸 → 卡通头像
微调完成后,推理阶段的流程是:(1) GPT-4o 生成平衡人口属性的文本提示词 → (2) 微调后的 SDXL 从噪声中采样生成真实人脸 → (3) 质量过滤 → (4) DCTNet 风格化为 3D 卡通头像。
提示词由 GPT-4o #Hurst-et-al.-2024 生成,确保覆盖 7 个种族群体(White、Black、Indian、East Asian、Southeast Asian、Middle East、Latino #Karkkainen-et-al.-2021)、均衡的性别分布和从青少年到老年的年龄范围。示例提示词:"A photorealistic face of a middle-aged Indian woman with shoulders visible, displaying a facial expression of delight, plain white background."
风格化使用 DCTNet #Men-et-al.-2022 的预训练 3D cartoon 风格模型。DCTNet 是一种域校准翻译(Domain-Calibrated Translation)架构,仅需约 100 张风格样本即可实现高质量风格迁移。论文框架设计允许替换为其他风格化方法,评估管线仍可适用。
图 2 展示了 GenEAva 1.0 数据集中的生成示例——每对图像展示同一种表情在真实风格和卡通风格下的呈现:
3.3 与 Liu et al. 的范式差异
GenEAva 与最相关工作 Liu et al. #Liu-et-al.-2024 的核心差异不在于模型规模或数据量,而在于问题范式:
| 维度 | Liu et al. (CVPR 2024) | GenEAva (FG 2025) |
|---|---|---|
| 问题范式 | 表情迁移(Expression Transfer) | 表情分布学习(Distribution Learning) |
| 输入需求 | 目标身份 + 参考表情图像 | 仅文本提示 |
| 表情来源 | 从 135 类数据集中选取参考图 | 从微调模型学习的分布中采样 |
| 身份控制 | 保留特定身份 | 生成全新身份(验证无记忆化) |
| 训练损失 | 标准条件扩散损失 | DM 损失 + 表情损失(POSTER MSE) |
| 风格化 | 无 | DCTNet 3D 卡通风格 |
这种范式差异使得 GenEAva 能够生成更多样化的表情表现,而不受限于参考图像的多样性。但代价是 GenEAva 不支持给定身份的多表情生成——同一身份在不同表情下可能不一致。这一问题由后续工作 Gen-AFFECT(WACV 2026)解决。
4.1 训练数据准备
GenEAva 的微调数据来自 Emo135 #Chen-et-al.-2022 数据集——一个包含 135 类细粒度表情、共 696,168 张人脸图像的大规模数据集。但 GenEAva 并未使用全部数据,而是经过三步预处理构建了一个极小的均衡子集:
- RetinaFace 人脸检测裁剪 #Deng-et-al.-2019retinaface:统一输入格式,去除无关背景
- 水印过滤:使用水印检测算法移除含水印的图像,防止模型学习到水印特征
- 平衡采样:从原始不均衡数据集中为 135 类各采等量样本,最终仅保留 1,080 张(每类约 8 张)
1,080 张是一个极小的训练集。这个规模的选择并非偶然——它配合 LoRA 低秩微调,有意限制模型的学习能力,防止对训练身份的过度记忆。论文明确指出:"More epochs lead to overfitting and worse image quality"——超过 8 个 epoch 后图像质量下降。
4.2 微调策略与优化配置
GenEAva 使用 LoRA #Hu-et-al.-2021(rank=4)微调 SDXL,而非全参数微调。LoRA 的核心思想是将权重更新 $\Delta W = BA$ 分解为两个低秩矩阵($A \in \mathbb{R}^{4 \times d}$, $B \in \mathbb{R}^{d \times 4}$),大幅减少可训练参数。rank=4 是一个极低的秩,意味着只引入最少量的可训练参数,进一步降低过拟合和身份记忆风险。
训练使用 HuggingFace 官方 SDXL base 1.0 checkpoint。以下为完整的训练配置披露表:
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 训练数据 | 已披露 | Emo135 均衡子集,1,080 张(135 类 × ~8 张/类) |
| 训练硬件 | 已披露 | 4 × NVIDIA RTX A6000(每块 48GB 显存为外部信息,原文仅提及型号和数量) |
| 优化器 | 已披露 | Adam(β₁=0.9, β₂=0.999, weight decay=1e-2) |
| 学习率 | 已披露 | 1e-6(未提及 schedule 和 warmup) |
| Batch size | 已披露 | 1 |
| 训练步数 / 轮数 | 已披露 | 8 epochs(>8 epoch 过拟合) |
| 训练时长 | 未披露 | 原文未给出 |
| 模型参数量 | 部分披露 | 基座 SDXL(~2.6B 为外部估计,原文未明确给出),LoRA rank=4(具体可训练参数量未给出) |
| 精度格式 | 未披露 | 原文未给出 |
| Checkpoint 策略 | 未披露 | 原文未给出 |
| LoRA rank | 已披露 | 4 |
| 表情损失权重 α | 已披露 | 1.0(与 DM loss 等权) |
训练稳定性通过四重机制保障:(1) LoRA rank=4 极低秩限制可训练参数;(2) 学习率 1e-6 极低,确保参数更新幅度小而稳定;(3) 仅 8 个 epoch 防止过拟合;(4) weight decay=0.01 提供 L2 正则化。这些措施共同确保模型在 1,080 张小数据集上不发生身份记忆。
4.3 训练成本
论文使用 4 块 NVIDIA RTX A6000 GPU,batch size=1,8 个 epoch,训练数据仅 1,080 张。总训练步数约 8,640 步(1,080 × 8 / 1),但论文未报告具体训练时间和并行策略。考虑到数据量极小且训练轮数少,预计训练时间在数小时内可完成,但论文未给出精确数字。推理速度(单张生成时间)也未报告。
5.1 GPT-4o 提示词生成
推理阶段的第一步是生成平衡人口属性的文本提示词。GenEAva 利用 GPT-4o #Hurst-et-al.-2024 根据以下约束系统性生成大量提示词:
- 性别均衡:男性和女性等比例
- 7 个种族群体:White、Black、Indian、East Asian、Southeast Asian、Middle East、Latino(参考 FairFace #Karkkainen-et-al.-2021 的种族定义)
- 多年龄段:从青少年到老年
- 135 种表情:每种表情生成约 98 张图像
提示词结构为:[风格] + [年龄] + [种族] + [性别] + [附加特征] + [表情类别] + [背景]。例如:"A photorealistic face of a middle-aged Indian woman with shoulders visible, displaying a facial expression of delight, plain white background."
论文仅提供了一个示例提示词,未公开全部 13,230 张图像对应的完整提示词列表。GPT-4o 的具体 prompt 生成策略描述也不够详细,这是可复现性的主要缺陷之一。
5.2 采样与质量过滤
微调后的 SDXL 从标准高斯噪声 $\mathbf{z}_T \sim \mathcal{N}(0,1)$ 出发,通过文本条件 $\tau(p)$ 引导的逐步去噪过程生成真实风格人脸图像。论文未说明推理时的采样步数、guidance scale 和采样器类型(如 DDIM/DPM++等),这些参数对生成质量有显著影响。
生成后的图像经过两步质量过滤:
- 去除面部过近的图像:面部过于靠近镜头导致面部特征不完整的图像被移除
- 去除多人脸图像:包含多个面部的图像被移除
这两步过滤确保数据集中每张图像都是清晰的单人面部图像,适合后续风格化处理和下游应用。
5.3 DCTNet 风格化
质量过滤后的真实人脸图像通过 DCTNet #Men-et-al.-2022 的预训练 3D cartoon 风格模型转换为卡通头像。DCTNet(Domain-Calibrated Translation Network)是一种少样本人像风格化架构,仅需约 100 张风格样本即可实现高质量风格迁移。它通过域校准机制将源域(真实人脸)与目标域(风格化人脸)对齐,具有高保真内容合成能力和良好的泛化性。
风格化是管线的最后一步,也是表情和身份保持的关键环节。DCTNet 是独立训练的现成模型,论文未对风格化过程中表情保持的机制进行深入分析,而是通过 AMT 用户研究来验证效果(见 Part 6)。论文的 .tex 源码中曾包含一个风格化定量分析表(身份相似度 0.55 vs baseline 0.49,表情误差 7.5 vs baseline 12.6),但最终被注释删除,作者可能认为定量基线"not ideal"。
5.4 GenEAva 1.0 数据集产出
最终产出的 GenEAva 1.0 数据集包含 13,230 张卡通头像,覆盖 135 种表情,每种表情 98 张,性别均衡,7 个种族群体均衡分布,年龄从青少年到老年,背景为纯白。这是第一个同时覆盖细粒度表情(135 类)和人口属性均衡(7 种族)的卡通头像数据集。
GenEAva 设计了涵盖四个维度的评估管线:(1) 表情生成质量、(2) 身份记忆化检测、(3) 风格化保持验证、(4) 与 ChatGPT 的定性对比。
6.1 实验配置
| 配置项 | 披露状态 | 值 / 说明 |
|---|---|---|
| 评测数据集 | 已披露 | Emo135 评估子集(每类 50 张,共 6,750 张) |
| 评测指标 | 已披露 | CLIP↑ / DINO↑ / LPIPS↓ / Expression Error↓ |
| Baseline 方法 | 已披露 | SDXL(原始未微调模型) |
| 推理硬件 | 已披露 | 4 × NVIDIA RTX A6000 |
| 推理分辨率 | 未披露 | 原文未给出(SDXL 默认 1024×1024) |
| 推理环境 | 未披露 | 原文未给出 |
6.2 表情生成质量
GenEAva 与原始 SDXL 在四个指标上进行对比。评估集从 Emo135 中每种表情随机采样 50 张,共 6,750 张。
| Model | CLIP ↑ | DINO ↑ | LPIPS ↓ | Exp. ↓ |
|---|---|---|---|---|
| SDXL #Podell-et-al.-2023 | 0.780 | 0.738 | 0.658 | 13.1 |
| GenEAva (Ours) | 0.799 | 0.742 | 0.648 | 12.6 |
各指标含义:CLIP 为 CLIP 嵌入余弦相似度;DINO 为 DINOv2 嵌入相似度;LPIPS 为基于 AlexNet 的感知距离;Expression Error 为 POSTER 表情嵌入的欧氏距离 #Chen-et-al.-2022。
GenEAva 在所有 4 个指标上均优于 SDXL。CLIP 提升最大(+2.4%),表明微调后模型在语义一致性上有明显改善。Expression Error 改善 3.8%,说明 POSTER 引导的表情损失确实提升了表情准确性。
6.3 身份记忆化检测
身份记忆化是 GenEAva 关注的核心隐私问题。论文通过 ArcFace #Deng-et-al.-2019arcface 提取身份嵌入,计算生成图像与训练数据中图像的余弦相似度。验证阈值通过最大化信息增益的算法确定为 0.68。
| 比较对象 | 验证阈值 | 平均余弦相似度 | 超过阈值数 |
|---|---|---|---|
| GenEAva vs. Emo135(微调数据) | 0.68 | 0.39 | 0 |
| GenEAva vs. CelebA(SDXL 预训练数据近似) | 0.68 | 0.47 | 0 |
两组对比中,没有任何生成面孔超过验证阈值,平均相似度远低于 0.68。在用户研究中,5 名参与者对 100 对图像进行判断,虽然部分参与者识别出少量与 CelebA 名人相似的面孔(1-5 对/人),但所有相似面孔均来自 CelebA 而非微调数据 Emo135。作者将此归因于 SDXL 在大规模公开数据集上的预训练中名人被过度代表,并承诺在最终数据集中移除这些图像,同时应用机器遗忘算法。
6.4 风格化保持:AMT 用户研究
风格化保持通过 Amazon Mechanical Turk (AMT) 用户研究验证。研究设计如下:
| 设计要素 | 具体设置 |
|---|---|
| 平台 | Amazon Mechanical Turk |
| 样本数 | 945 对(135 类 × 7 对/类) |
| 评估者/HIT | 9 名 |
| 每 HIT 图片对数 | 15(含 1 测试题) |
| 最大完成时间 | 9 分钟 |
| 评估者资质 | ≥500 HITs,approval rating ≥95% |
| 评估维度 | 身份保持 & 表情保持(二分类) |
| 质量控制 | 测试题答错则 HIT 丢弃(论文 .tex 源码注释提及约 42% 的 HIT 被丢弃,此数据来自源码注释,非发表正文) |
| 表情保持率 | 96% |
| 身份保持率 | 93% |
6.5 与 ChatGPT 的定性对比
论文还将 GenEAva 与 ChatGPT(GPT-4o + DALL-E 3)进行定性对比,展示了 4 种微妙表情的生成差异:
| 表情 | ChatGPT 生成 | GenEAva 生成 | 语义正确性 |
|---|---|---|---|
| compassion(同情) | 微笑(不符合语义) | 轻微皱眉(更准确) | GenEAva ✓ |
| desire(渴望) | 中性面孔(完全失败) | 正确捕捉微妙表情 | GenEAva ✓ |
| sympathy(同情) | 中性面孔(完全失败) | 正确捕捉微妙表情 | GenEAva ✓ |
| jealousy(嫉妒) | 过度夸张 | 更适度 | GenEAva ✓ |
这表明即使是商用多模态 LLM,也难以准确生成某些微妙面部表情。GenEAva 通过表情引导微调,在细粒度表情生成上具有明显优势。但此对比仅为定性展示(4 个表情类别),缺乏定量评估。
6.6 消融实验评估
论文的主要消融发现是训练轮数的影响:超过 8 个 epoch 导致过拟合和图像质量下降。这是通过实验摸索得到的关键经验性结论。但论文缺少以下消融实验:表情损失的单独贡献(仅 DM loss vs DM + expression loss)、不同 $\alpha$ 权重的效果、LoRA rank 的影响、不同风格化方法的对比。这些缺失限制了我们对各组件贡献的理解。
7.1 在技术地图上的位置
GenEAva 的贡献定位明确:它不是一个新模型架构,而是一个数据基础设施。在面部表情生成领域,从 StarGAN #Choi-et-al.-2018 的 6 类基本表情到 GenEAva 的 135 类细粒度表情,表情粒度提升了一个数量级。GenEAva 1.0 是第一个同时覆盖细粒度表情和人口属性均衡的卡通头像数据集,为卡通 FER 训练、社交媒体头像生成和教育虚拟形象等下游应用提供了数据基础。
但 GenEAva 也有明确的能力边界:它只处理静态图像生成,不涉及视频/动画;不支持给定身份的多表情一致性生成;风格化模块固定为 DCTNet 的 3D cartoon 风格;推理速度未优化,不适合实时应用。
7.2 局限性分析
从方法论角度,GenEAva 存在以下局限:
- 训练数据极小:仅 1,080 张图像(每类约 8 张),虽有助于防止身份记忆,但可能限制表情多样性
- 一步逆近似精度:$\hat{\mathbf{x}}_0$ 是粗略近似,尤其在训练初期,可能引入噪声到表情损失中
- 自评估偏差:Expression Error 使用 POSTER 计算,而 POSTER 同时是训练编码器
- 两阶段管线误差累积:表情生成和风格化独立进行,风格化可能导致表情信息损失(4% 表情丢失)
- 缺少关键消融:未报告表情损失、$\alpha$ 权重、LoRA rank 的消融实验
论文在伦理声明中指出,GenEAva 1.0 数据集仅用于研究目的,生成的人脸图像不 depict real individuals。对于 AMT 用户研究中识别出的少量与 CelebA 名人相似的面孔,作者承诺在最终数据集中移除并应用机器遗忘算法 #Yu-et-al.-2025。
7.3 后续工作与启发
同一团队的后续工作 Gen-AFFECT(WACV 2026)直接解决了 GenEAva 的身份一致性问题:基座模型从 SDXL 升级到 SD 3.5(Rectified Flow + MM-DiT),引入身份条件化和一致注意力机制,实现给定身份在 135 种表情下的身份一致生成。这可以看作 GenEAva 的"升级版"。
GenEAva 给我们的启发包括:
- 分布学习优于迁移学习:当参考图像有限时,微调模型学习分布并直接采样,比依赖参考图迁移更灵活
- 一步逆公式是实用的训练技巧:在扩散模型训练中引入额外语义损失时,一步逆近似提供了计算可行的梯度通路
- 隐私优先设计有效:LoRA rank=4 + 小数据 + 少量 epoch 的三重控制,配合 ArcFace 验证,建立了身份新颖性的可信度
- GPT-4o 可用于数据集平衡:利用 LLM 生成平衡人口属性的提示词,从源头解决数据集偏差
对于想构建类似数据集的研究者,GenEAva 的管线可以直接复用:选择基座扩散模型 → 在目标属性数据集上 LoRA 微调(配合属性引导损失)→ GPT-4o 生成平衡提示词 → 风格化后处理 → 多维评估。框架的模块化设计使得每个组件都可以独立替换和改进。
参考来源
- Yu, H. et al. (2025). GenEAva: Generating Cartoon Avatars with Fine-Grained Facial Expressions from Realistic Diffusion-based Faces. IEEE FG 2025. arXiv:2504.07945
- Podell, D. et al. (2023). SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis. ICLR 2024. arXiv:2307.01952
- Chen, K. et al. (2022). Semantic-Rich Facial Emotional Expression Recognition. IEEE Transactions on Affective Computing, 13(4), 1906–1916.
- Zheng, C. et al. (2023). POSTER: A Pyramid Cross-Fusion Transformer Network for Facial Expression Recognition. ICCV Workshop 2023. arXiv:2204.04083
- Men, Y. et al. (2022). DCT-Net: Domain-Calibrated Translation for Portrait Stylization. ACM TOG (SIGGRAPH 2022), 41(4), 1–9. arXiv:2207.02426
- Liu, R. et al. (2024). Towards a Simultaneous and Granular Identity-Expression Control in Personalized Face Generation. CVPR 2024, 2114–2123. arXiv:2401.01207
- Hu, E. J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685
- Choi, Y. et al. (2018). StarGAN: Unified Generative Adversarial Networks for Multi-Domain Image-to-Image Translation. CVPR 2018, 8789–8797. arXiv:1711.09020
- Ho, J. et al. (2020). Denoising Diffusion Probabilistic Models. NeurIPS 2020. arXiv:2006.11239
- Hurst, A. et al. (2024). GPT-4o System Card. OpenAI.
- Kärkkäinen, K. & Joo, J. (2021). FairFace: Face Attribute Dataset for Balanced Race, Gender, and Age for Face Recognition. IEEE TPAMI 2021.
- Somepalli, G. et al. (2022). Diffusion Models Already Have a Semantic Latent Space. ICLR 2023. arXiv:2210.10960
- Carlini, N. et al. (2023). Extracting Training Data from Diffusion Models. USENIX Security 2023.
- He, Z. et al. (2024). SynFER: Synthesizing Facial Expressions for Facial Expression Recognition. NeurIPS 2024.
- Google. Cartoon Set. google.github.io/cartoonset
- Fujimoto, A. et al. (2016). Manga109 Dataset. arXiv:1511.08345
- Nowak, K. L. & Fox, J. (2018). Avatars and Computer-Mediated Communication. Review of Communication Research.
- Deng, J. et al. (2019). ArcFace: Additive Angular Margin Loss for Deep Face Recognition. CVPR 2019, 4690–4699. arXiv:1801.07698
- Deng, J. et al. (2020). RetinaFace: Single-Shot Multi-Level Face Localisation in the Wild. CVPR 2020. arXiv:1905.00641