Contents — find the section you need
判别模型学习的是 p(y|x),而生成模型则表示 p(x) 或 p(x|c),通常是通过最大化以下参数来实现:
VAE 使用潜在变量和变分边界;GAN 以对抗的方式训练生成器和判别器;扩散模型学习逆转噪声过程。
图示:Duskcoil。它不保证生成输出的真实性、权利、来源或安全性。
评估条件遵守情况、事实性、隐私性、版权、偏见、有害输出和披露情况——而不仅仅是视觉指标。未经原始来源验证,请勿将生成的材料视为证据。
三种模型及其实现权衡
VAE 使用编码器 q_\phi(z|x) 和解码器 p_\theta(x|z),并最大化 ELBO,以平衡潜在分布的重构和正则化。GAN 训练一个在极小极大博弈 \min_G\max_D\mathbb E[\log D(x)]+\mathbb E[\log(1-D(G(z)))] 中,生成器和判别器可以产生尖锐的输出,但模式崩溃和训练不稳定仍然是需要关注的问题。扩散模型逐步向 x_0 添加噪声,并学习预测噪声 \epsilon,从而近似地模拟逆过程。质量、速度、可控性、似然性和内存占用是不同的权衡因素。
| 家族 | 优势 | 观察点 | 典型控制 |
|---|---|---|---|
| VAE | 可解释的潜在表示 | 模糊和近似误差 | 潜在变量和条件 |
| GAN | 尖锐的高频外观 | 模式崩溃和判别器不稳定 | 条件和潜在搜索 |
| 扩散 | 高质量和条件 | 迭代采样和溯源 | 文本、图像、引导 |
失败案例和评估
看似合理的图像和文字并不一定真实。训练短语的记忆、人员、商标或机密数据的泄露,与指令无关的输出、偏差放大和捏造引用是常见的失败案例。应结合溯源追踪、相似性搜索、专家评审、红队演练和特定条件下的人工评估,而不是依赖单一的自动指标。切勿将生成的输出用作医疗、法律或安全操作的主要证据。
记录输入条件、系统提示、模型版本、随机种子、过滤器和生成时间。检查版权、隐私和使用条款;不要将机密输入发送给外部服务。拒绝危险请求,并对含糊不清的请求进行澄清。生成的图像应标记为合成图像,并应考虑对相关人员的同意和分发方式。
-
明确生成目标和禁止用途。
-
跟踪溯源、许可和删除请求。
-
分别评估合规性、事实性、泄露和偏差。
-
提供人工批准、来源检查、拒绝和回滚机制。
条件、搜索和可复现性
提供条件并不能保证它一定会被遵守。强大的无分类器指导可以提高条件的遵守率,但同时也会降低多样性或导致饱和。温度、top-p 值、迭代次数和指导尺度既是质量控制指标,也是可复现性和计算成本的规范。保存模型标识符、权重哈希、调度器、种子和预处理信息,而不是依赖默认值。
在检索或生成外部数据条件时,将生成的文本与检索到的证据分开。现有的 URL 并不能证明某个声明得到了支持。存储搜索时间、查询、文档版本和引用跨度;如果证据不足,请明确指出,而不是猜测。使用 JSON Schema 验证结构化输出,并独立测试语法和真实性。
比较评估设计
| 轴 | 自动示例 | 人工/操作检查 | 陷阱 |
|---|---|---|---|
| 保真度 | FID、感知距离 | 伪影和合理性 | 指标分布过拟合 |
| 多样性 | 覆盖率、重复率 | 单一条件下的范围 | 无关变化计入多样性 |
| 条件遵守情况 | 分类器、字符串匹配 | 指令级评分 | 评估者偏差 |
| 事实性 | 证据匹配率 | 专家声明审查 | 误将流畅性视为真理 |
| 安全性和权利 | 过滤器检测率 | 上下文、同意、目的 | 回避或过度拒绝 |
评估集中应包含模糊指令、冲突条件、已知人物肖像、看似个人化的字符串、危险领域以及不支持的语言。除平均值外,还应报告最严重情况和拒绝率。人工评估应记录提示、顺序、盲法以及评分者间一致性。
失败案例:从成功的演示到无监督发布
少量吸引人的示例掩盖了重复提示、提示注入、类似训练数据的输出以及长时间对话中条件丢失等问题。将用户输入直接发送到未来的训练中可能会持久化个人数据或滥用数据。定义同意、目的、保留和删除路径;隔离并审查训练候选模型。赋予使用工具的模型最小权限、参数验证、执行前确认以及成本和调用次数限制。
一个小型分阶段实施方案
-
将真正需要生成的内容与搜索、模板或人工即可满足需求的内容区分开来。
-
将接受和禁止条件转换为包含示例的固定评估集。
-
保持输入/输出过滤器、证据检查和模式验证独立于模型。
-
使用有限的受众进行影子测试,并测量失败类别、延迟、重试次数和审查工作量。
-
确定版本,逐步推出,并在发生严重事件时恢复到安全响应或禁用该功能。
-
每次更新后重新运行固定集和事件集,以检测回归和改进。
质量并非单一基准。产品规范必须说明哪些内容不生成、显示哪些证据以及谁批准结果。
操作边界和变更管理
责任边界应在界面中清晰可见。用户可以编辑的草稿、经证据核查的摘要以及自动执行的命令不应采用相同的视觉处理方式。应显示已生成输出、已检查的内容、参考来源以及上次更新时间。高影响操作应转换为可输入的候选语句,并经过授权和用户批准,而不是直接从生成的文本执行。
提供商更新、过滤器更改和提示更改均属于行为变更。应固定可复现的版本并比较差异,包括新拒绝的正常输入、特定语言的回归、成本和延迟。在系统退役时,应检查日志、嵌入、缓存和微调数据的删除范围。将去标识化的红队失败案例(包括释义)添加到回归测试中,并将事件计数与使用率、拒绝率和审核拒绝情况一起进行分析。
看似合理的生成输出是否能证明某个事实?
与已学习数据相似并不能证明其正确性。请检查与任务相关的来源、约束条件和外部验证。
评论
请先登录。
暂无数据。