本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。
L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.
— 《进步者日报》编辑部 / La rédaction
表达性语音滤镜会改变听者的情感推断。这不是假设,而是发表在《皇家学会哲学汇刊B》上的研究结论。当声音经过一个使其更”带笑”的滤镜,听者会认为说话者的情绪比实际更好,并相应调整自己的情感反应。中介不再传递情感,而是制造了另一种情感。
这一机制已走出实验室。改变音色的语音滤镜已集成到部分平台——Discord提供原生滤镜,第三方工具也可与Zoom或WhatsApp配合使用。不过,能够微妙调整声音情感内容的表达性情感滤镜(即Guerouaou研究所指的那类)在很大程度上仍处于原型或有限部署阶段。每天有数百万人通过实时调整声音的滤镜交流,他们未曾主动选择,对话者也未被告知。技术改变交流方式,这没有争议。真正的问题是:当干预直接作用于情感本身,在情感抵达他人之前,会发生什么。
要点
- 《皇家学会哲学汇刊B》上的研究证实,表达性语音滤镜会改变听者的情感推断,与说话者的真实情绪无关。
- 改变音色的滤镜已在部分平台部署,但高级表达性情感滤镜仍大多处于实验阶段。用户看不到这一区别。
- 神经科学家Nadia Guerouaou和人类技术基金会指出一项结构性风险:由平台定义的单一情感规范正在逐步成为默认标准。
- 现有监管框架——GDPR、欧盟《人工智能法案》、注意力经济相关讨论——均未明确涉及实时情感表达修改问题。
- 关键窗口是一代人的时间:如果表达性滤镜的普及轨迹与照片滤镜相似,真实情绪与传递情绪之间的落差将在被识别为问题之前,就已成为结构性现实。
声音承载的,文字无法替代
声音不只是信息传输的渠道。它是副语言交流的主要载体:音色、节奏、强度变化、表示疑虑的微小停顿、暴露疲惫或焦虑的语调。数十年的交流心理学研究表明,听者对这些信号的处理快速且大多无意识,它们先于并制约着对言语内容的解读。
表达性滤镜干预的正是这一层面。让声音更”带笑”,不是改变词语,而是改变副语言信号的声学结构。《皇家学会哲学汇刊B》的研究结果由此显出全部意义:听者不会将过滤后的声音识别为”被工具修改过的声音”,他们只是听到一种声音,并从中推断出一种情绪。滤镜消失在感知里,被制造的情绪取代了真实情绪。
与其他技术中介的比较能说明这种差异。电话扭曲频率,MP3压缩切断部分音域,这些都是无意的损耗,是传输渠道的副产品。表达性滤镜则相反:它是有意添加的,是为达到特定情感效果而对信号进行的修正。它的目的不是传递声音本来的样子,而是传递一种按照某个参数”应该”被感知的声音。
配置默认设置的隐形规范
当滤镜让声音更”带笑”,它已经内含一个判断:微笑优于中性。这个判断并非中立,它反映了特定文化规范——即所谓WEIRD文化(西方、受过教育、工业化、富裕、民主),尤其是针对美国市场校准的大型科技平台的文化标准。在许多文化中,声音保持中性意味着严肃与尊重,过度的声音热情反而被视为不真诚或流于表面。
这是神经科学家Nadia Guerouaou论点的核心。她专注于研究AI系统中的认知偏差,人类技术基金会的相关报告也对其观点有所梳理。表达性滤镜在文化上并非中立,它们将一种情感规范编码其中,并在平台规模上加以传播。当这种规范成为数亿用户的默认设置,它就不再是一个可选项,而是数字交流的情感底色。
媒体史上有过类似的先例。20世纪50年代,电视逐渐向新闻记者强加了一套特定的表达方式:说话节奏、停顿处理、情感基调,这套规范成为许多国家专业交流的标准。在西方学校受训的非洲或亚洲广播记者,往往也采用了这套外来的腔调。语音滤镜与之的区别在于机制:电视通过模仿和培训实现标准化,而滤镜则在实时且不可见的情况下完成这一过程。人们看不到滤镜,因此也无从抵抗其影响。
监管者尚未关注的盲区
欧盟2024年通过的《人工智能法案》按风险等级对系统分类,对高影响系统设有透明度义务,并明确针对工作场所和教育机构中的情绪识别系统。但它没有涉及日常交流中实时情感表达修改的滤镜。这不是一个细节性的遗漏——这恰恰是当前最分散、覆盖最广的机制。
GDPR一侧,情绪状态相关数据作为敏感数据受到保护,但保护范围仅限于数据的收集与处理。传输前的情感表达修改不在此列:滤镜作用于声学信号,不收集、不存储用户情绪数据,因此游离于这一框架之外。
过去十年,注意力经济的批判性讨论聚焦于注意力捕获及其对心理健康、民主和市场集中的影响,产生了重要研究和部分监管成果。但这些讨论的前提是:发送者的信号完整抵达听者,问题出在信号过载,而非信号被改变。表达性滤镜将问题转移了:需要审视的不再是信号的数量,而是它的情感质量。
经济学家Daron Acemoglu关于技术与权力的研究在此提供了有益视角。Acemoglu区分了两类技术:一类增强人的能力,另一类则替代或重塑人的能力,并将控制权转移给部署者。表达性滤镜明显属于后者——它不是给用户更好的表达控制权,而是将这种控制权转移给平台。治理这一问题,本质上是政治问题,而非技术问题。
照片滤镜的类比,以及它为何无法令人放心
最常见的反驳是照片滤镜的类比。Instagram在2012年普及了自动图像修饰,用户学会了将过滤后的照片识别为过滤后的照片,社会消化了这一新的视觉规范,没有引发感知层面的崩溃。为何语音滤镜会有所不同?
至少有两条具体理由。其一是信号的性质。一张修饰过的照片在视觉上仍然是照片,其轮廓、构图、场景布置可被识别为人工制品。声音则不同,它由更古老、更少分析性的认知回路处理。关于韵律处理的研究显示,基于声音的情感推断大多是前意识的,难以通过理性反思加以修正。语音滤镜消失在感知中的程度,是视觉滤镜无法比拟的。
其二是交流的互动性。语音交流是一个循环:我从对方声音中听到的内容调节我的情感反应,这又反过来影响我自己的表达。如果双方都通过滤镜交流,对话的情感动态便完全由两个平台的算法构建。所谓的”对话”,实质上是两个经过滤镜处理的表征之间的交流。双方共享的情感,是算法协商的产物。
这一轨迹值得量化。照片滤镜大约用了十年从新奇功能变成隐性标准。如果语音滤镜遵循类似的普及曲线,2015年后出生的用户将从未接触过未经过滤的数字语音交流标准。这一规范不会被选择,只会被继承。
明智的监管能做什么——以及悬而未决的问题
目前有两种立场正在形成,将其简化为支持技术与反对技术之争会误导判断。第一种立场接近Acemoglu和Johnson关于技术治理的主张,要求建立告知义务:任何启用的表达性滤镜都必须通知发送者,在专业或机构场景下还须通知接收者。这不是禁止,而是最低限度的透明度,让用户意识到中介的存在。
第二种立场在工具选择上更倾向自由市场,依赖竞争与差异化。如果表达性滤镜成为公共议题,部分平台或许会将”不滤镜”作为商业卖点。了解这一机制的用户可以主动选择不过滤的工具。在信息充分流通的前提下,市场压力可以实现监管难以达到的目标。
两种立场有一个共同点:核心问题不是滤镜的存在,而是它的不可见性。可见的滤镜可以被质疑、关闭、讨论;不可见的滤镜则在不留任何痕迹的情况下塑造现实。监管最应优先处理的,正是这种信息不对称。
还有一个问题两种立场都没有解答:谁来定义滤镜据以调整信号的情感规范?这不是技术决定,而是对何为”正常的”、”适当的”、”可取的”情感表达的价值判断,属于公共讨论的范畴,而非工程师的职权。这场讨论尚未开始。
可以设想类似广告监管或媒体图像修改规范那样的制度性约束,可以设想针对表达性过滤系统的审计认证,可以设想用户访问默认参数的权利。更难设想的是:如何将一个已被技术采用速度变成既成事实的问题,重新纳入政治讨论?
数字身份问题用了二十年才进入法律和制度。交流情感修改的讨论尚未开始。平台的速度与民主的速度之间的时间落差,才是真正需要审视的核心问题——而不是某个具体的滤镜。
来源
- 人类技术基金会 / Nadia Guerouaou,”Emotions and Sociability in the Age of AI Filters”:https://www.human-technology-foundation.org/news/emotions-and-sociability-in-the-age-of-ai-filters
- 《皇家学会哲学汇刊B》——生物和认知科学领域的权威期刊(伦敦皇家学会)
- Daron Acemoglu 和 Simon Johnson,《权力与进步》(PublicAffairs,2023)
- 欧盟人工智能法规(AI Act),《欧盟官方公报》,2024
- Guerouaou 等人(2021),”Voice modulation: from origin and mechanism to social consequences”,《皇家学会哲学汇刊B》:https://royalsocietypublishing.org/rstb/article/376/1840/20200386/108749/Voice-modulation-from-origin-and-mechanism-to
- 人类技术基金会——“Émotions et sociabilité à l’ère des filtres IA”:https://www.human-technology-foundation.org/fr-news/emotions-et-sociabilite-a-lere-des-filtres-ia
- 欧盟委员会——AI Act(禁止条款):https://digital-strategy.ec.europa.eu/en/policies/regulatory-framework-ai
- 未来隐私论坛(FPF)——“Red Lines Under EU AI Act: Unpacking the Prohibition of Emotion Recognition in the Workplace and Education Institutions”:https://fpf.org/blog/red-lines-under-eu-ai-act-unpacking-the-prohibition-of-emotion-recognition-in-the-workplace-and-education-institutions/
- CNIL——关于欧盟人工智能法规的问答:https://www.cnil.fr/fr/entree-en-vigueur-du-reglement-europeen-sur-lia-les-premieres-questions-reponses-de-la-cnil
- PubMed——情感韵律的前意识处理:https://pubmed.ncbi.nlm.nih.gov/17964813/
- Nadia Guerouaou——IRCAM:https://www.ircam.fr/person/-98/
- Nadia Guerouaou,《我们被影响的大脑》(Eyrolles,2026):https://www.amazon.fr/Notre-cerveau-sous-influence-g%C3%A9n%C3%A9ratives/dp/2416023489