数据是AI的燃料。但在很多关键领域——如自动驾驶的极端场景、罕见病的医学影像——真实数据极度稀缺。合成数据技术正在成为突破这一瓶颈的钥匙。

技术原理

合成数据不是简单的数据增强,而是利用生成式AI创建全新的、统计特征与真实数据一致但又不完全相同的训练数据集。NVIDIA的Omniverse Replicator可以在虚拟环境中生成无限多样的自动驾驶训练场景——从暴雨夜间的行人横穿到沙尘暴中的对向来车——这些场景在现实中极难捕捉。

应用突破

Waymo和特斯拉的自动驾驶训练中,合成数据已占场景数据的30%以上,特别是在长尾危险场景的训练中。在医疗影像领域,英伟达和多家医院合作利用生成式AI合成高保真的病理切片图像,将罕见病AI诊断模型的训练数据量提升了50倍。

合成数据之于AI,就像模拟飞行器之于飞行员——无需经历真实的危险就能学会应对一切。

隐私优势

合成数据天然具有隐私保护属性——它不包含任何真实个人的信息,却保留了数据的统计特性。这使得医疗、金融等领域可以在完全合规的前提下共享"数据价值"而不共享"数据本身"。英国NHS和MIT正在合作建设全球最大的合成医疗数据集,供全球AI研究人员自由使用。