首页 > 韬安资讯 > 详情

韬安说 | AI语音合成背景下“声音权益”的法律认定与保护

2026-01-23

引言:

随着人工智能语音合成技术的发展,通过机器学习模型对真人声音进行训练,生成与其高度相似的“克隆声音”已成为现实。这给配音演员、歌手等以声音为职业的人士带来了全新的法律风险:未经授权,他人即可复制并传播与其声音极为相似的音频作品。

2024年,出演漫威电影中“黑寡妇”角色、被粉丝称为“寡姐”的著名女演员斯嘉丽・约翰逊(Scarlett Johansson)公开指控OpenAI公司,称其发布的语音助手“Sky”使用了与她嗓音高度相似的AI语音,甚至连其亲友和多家媒体都难以辨别两者差异。虽然OpenAI否认该语音由斯嘉丽录制或基于其声音生成,但其曾在产品上线前两度邀请斯嘉丽为语音模型配音且均被拒绝授权。最终,斯嘉丽通过律师函要求OpenAI下架“Sky”语音并公开说明制作过程。[1]

而在我国,全国首例AI生成声音侵害人格权案件已经由北京互联网法院作出判决。该案中,配音演员殷某桢发现其声音被用于人工智能合成语音,并在多个网络平台传播,而她从未许可任何机构“AI化”自己的声音。法院最终认定相关公司的行为侵犯了配音演员对其声音所享有的人格权益,判令相关被告书面赔礼道歉、赔偿经济损失25万元。[2]这一判决标志着我国司法实践开始正式回应AI合成声音带来的法律问题。本文将以该案为基础,结合《民法典》相关条款,从声音权益的法律地位、侵权判断标准、AI训练的授权风险等方面展开分析,并与国外实践作简要对照。

一、“声音权益”的法律地位:法定人格权益,参照肖像权保护

人的声音是一种独特而具有识别性的人格要素,与姓名、肖像一样能够标识个人身份并体现人格尊严。我国现行《民法典》虽然未将“声音权”单列为具体人格权类型,但在第1023条第2款中明确规定:“对自然人声音的保护,参照适用肖像权保护的有关规定”。这意味着,尽管立法尚未将声音明确称为独立的人格权,但自然人的“声音”仍受法律保护,其法律地位属于民法典意义上的法定人格权益,对其的保护应比照肖像权的规则进行。

可识别性:认定AI声音侵权的核心标准

依据《民法典》1018条,对于肖像的法律保护以“可被识别”为前提。同理,声音要受到人格权法保护,其前提条件也在于该声音具有可识别性,即通过声音能够让公众识别、联想起特定自然人。换言之,如果一段声音完全无法使他人联系到其来源人格主体,则该声音不属于受法律人格权保护的范围。正因如此,“AI合成声音是否具备可识别性”成为判断侵权与否的核心。有观点认为,对于声音可识别性的认定,需综合考虑主观标准、客观标准和使用方式三方面因素[3]

1. 主观标准(社会公众认知):考察一般社会公众或特定范围内的群体能否通过声音将其与特定自然人对应起来。对于社会知名度高、声音特征鲜明的公众人物,应以一般社会大众的认知作为判断标准,只要普通听众“闻其声即知其人”,即可认定具有可识别性。而对于职业配音演员等在其专业领域具有一定知名度的人,其声音是否可识别则应基于该领域相关公众的认知。相反,如果是普通人,声音缺乏知名度且音色、语调特点不突出,一般听众乃至其熟人圈可能都难以凭声音辨认出其身份。此时再以主观公众认知来判定意义不大。

2. 客观标准(声纹技术比对):借助声纹识别、声谱分析等客观技术手段,比对待测声音与特定自然人原声音频在音色、频率、语调等方面的一致性,以确认二者是否高度相似。客观标准在声音识别中起兜底作用:无论是知名人士抑或普通人,都可以通过技术比对来辅助认定声音来源。特别是在普通人声音无人能凭直觉识别的情况下,客观声纹鉴定就成为确认是否使用了他人声音的重要方法。

3. 使用方式(情境及内容关联):分析声音被使用的场景、方式以及是否伴随特定内容,从而判断该使用是否容易让人将声音与权利人产生联系。例如,将知名演员在影视剧中的代表性台词连同其原声一起用于商业作品,受众很可能据此联想到该演员本人,从而构成对其声音权益的侵害。[4]再如,在AI合成声音的应用中,如果明确标注或提示该声音为AI合成且非真人,不涉及冒用他人名义,则相比偷偷模拟他人嗓音用于广告代言等情形,引发混淆误认的可能性会相对降低。然而需要注意,即便技术上添加了数字水印标记区分AI声音,只要普通听众无法察觉区分,仍不影响从一般公众认知角度认定声音来源的可识别性。

综合上述标准,只要认定AI生成的声音在特定范围内能够与某自然人建立对应联系,即可视为具备“可识别性”,继而可以认定权利人的声音人格利益延及该AI声音。在殷某某诉北京某科技公司一案中,法院正是结合主客观两方面认定:被诉AI语音在音色、语调、风格上与原告录制声音高度一致,足以令配音圈内的听众将之认出为原告的声音,因而判定原告对该AI合成声音享有人格权益。

二、未经授权“投喂”声音数据的法律风险

AI模型的训练高度依赖于海量数据,但对于涉及人格权益的声音数据,企业若未经权利人授权即投入算法进行训练,将面临侵权风险。参照《民法典》第1018条第2款对于肖像权的保护规定,自然人对其基于“可被识别”声音的控制权,包括决定是否允许他人使用其声音的权能。将他人声音数据用于训练AI、生成新声音,本质上属于对他人声音的“使用”,若未获许可,已构成对声音权益的侵犯。即使最终生成的AI声音由于混合多素材等原因而不足以识别出某特定个人,亦不能据此豁免侵权责任:在这种情形下,虽然权利人的声音权益可能无法延及输出的新声音,但训练过程中未经许可使用他人声音这一行为本身即可通过客观声纹比对予以确认,一旦确认确有其事,同样属于对他人声音权益的侵害。

此外,企业不能因享有某段录音制品的著作权或使用权,就径行将其中人声用于AI训练。在殷某某案中,某传媒公司作为录音制品版权方,将配音演员录制的音频提供给AI技术公司用于模型开发,结果因为超出原告授权范围而被认定构成侵权。可见,声音作品的著作权人与表演者对其声音人格权益的许可是相互独立的。取得作品版权不意味着自动获得对表演者声音进行二次利用(特别是AI合成)的许可。企业如忽视这一点,贸然利用配音演员或其他主体的声音素材开发商业化AI语音产品,可能承担停止使用、赔礼道歉及赔偿损失等法律责任,赔偿金额将参考侵权情节以及由声音价值决定的市场损失来综合衡量。

三、国外案例比较:Midler诉Ford案的启示

美国Midler案确立的商业模仿即侵权规则,可为我国处理AI商业推广中声音模仿问题提供借鉴。早在人工智能技术出现之前,国外司法实践就已注意到对名人声音的保护。美国著名歌手兼演员Bette Midler曾在1988年成功起诉福特汽车公司未经许可使用与她嗓音极为相似的歌手在汽车广告中演唱歌曲。美国法院认定,广告商未经同意擅自“盗用”米德勒独特声音用于商业推广,侵犯了她作为公众人物对自身声音所享有的权益。该案确立了声音可以构成个人身份标识的一部分,模仿他人声音进行商业利用同样可能违法。无论是否使用原始录音,当一位专业歌手的独特嗓音广为人知,并被故意模仿以推销产品时,只要模拟出的声音足以引发公众误认,即可能构成侵权。[5]

在当下AI技术广泛应用的背景下,这一思路仍具现实指导意义。正如在Scarlett Johansson指控Open AI事件中,OpenAI发布的语音助手“Sky”声音酷似Scarlett Johansson的嗓音。尽管OpenAI否认使用原声,但事件仍引发公众广泛误认和法律争议。可见,在AI模拟能力日益逼真的情形下,公众误认门槛大幅降低,对声音权的保护亟需向更精细的识别标准和数据使用边界延伸。除可识别性等传统要素外,司法实践也应关注训练环节中数据使用的合规性。即使输出结果不具可识别性,若训练过程中存在未经授权使用特定自然人声音的情形,亦可能独立构成侵权。

结语

人工智能语音合成在给内容产业带来便利的同时,也不可避免地引发对人格权保护的挑战。我国《民法典》已通过参照肖像权保护的方式,将自然人声音纳入法律保障范围。“可识别性”是判断声音侵权的核心标准,但也不应忽视模型训练阶段对声音数据的合规使用。在可识别输出与数据来源合规之间寻求平衡,正是未来法律规范与司法适用的关键着力点。对于企业而言,尊重和保护声音等人格权益,不仅是法律义务,更是AI产业健康发展的底线。人工智能服务提供者在语音模型训练与优化过程中,应确保声音数据的授权明确、来源合法,切实履行对个体人格尊严的保护责任。唯有如此,方能在技术创新与权利保障之间实现良性互动,推动AI产业走向可持续与可托付的未来。


——撰稿人:段清晓


参考文献:
[1]澎湃新闻:《美国演员斯嘉丽称OpenAI未经同意刻意模仿其声音》,2024年5月21日,https://www.thepaper.cn/newsDetail_forward_27451985
[2]详见北京互联网法院(2023)京0491民初12142号民事判决书。
[3]北京互联网法院课题组:《AI生成声音侵害声音权益的法律认定》,《法律适用》2024年第9期,第123-133页。
[4]参见成都铁路运输第一法院,(2023)川7101民初8240号民事判决书。
[5]Midler v. Ford Motor Co., 849 F.2d 460 (9th Cir. 1988),见 Justia 法律数据库,https://law.justia.com/cases/federal/appellate-courts/F2/849/460/37485/

    - END -
    本栏目文章为本所为本行业及社会公众提供的公益性普法服务,不属于针对具体事项的法律意见,也不代表本所针对具体个案的意见或观点。