Auditing Exposure to Harmful Content on TikTok using Multimodal Language Models: A Cross-National, Age-Stratified Study

📄 arXiv: 2608.17583v1 📥 PDF

作者: Hamidreza Saffari, Francesco Pierri

分类: cs.CL

发布日期: 2026-08-18

备注: 20 pages, 16 figures, 14 tables. Accepted to Findings of EMNLP 2026


💡 一句话要点

利用多模态语言模型审计TikTok有害内容的跨国研究

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态语言模型 内容审计 青少年保护 社交媒体 跨国研究

📋 核心要点

  1. 核心问题:现有方法在审计在线平台有害内容时面临高成本和语言差异导致的审核不一致性。
  2. 方法要点:本文提出利用多模态语言模型进行视频内容审计,以降低标注成本并提高审核效率。
  3. 实验或效果:实验结果显示,关键词搜索的有害内容比例显著高于被动滚动,且在不同国家和年龄段中存在明显差异。

📝 摘要(中文)

在线视频平台可能会让年轻用户接触到有害内容,但独立审计仍然困难,因为视频标注成本高且不同语言的审核判断存在差异。本文在法国、意大利和瑞典对TikTok进行审计,使用代表四个年龄段(13、16、19、40岁)的虚假账户,收集了36,971个视频。通过对300个视频的参考集进行验证,发现Gemini 2.5 Flash模型在性能上最佳,且成本仅为本地视频上传的一半。关键词搜索显示有害内容比例为35-56%,在十个国家-年龄组合中,较基础滚动增加了1.5-7.5倍。整体而言,基于多模态语言模型的审计为跨国青少年安全审计提供了一种可扩展的方法。

🔬 方法详解

问题定义:本文旨在解决在线平台上有害内容审计的高成本和语言差异问题。现有方法在视频标注和审核一致性方面存在显著不足,导致难以进行有效的内容审计。

核心思路:论文提出利用多模态语言模型(MLLM)进行视频内容的自动审计,结合视频帧和文本信息,以提高标注的准确性和效率。通过这种方式,能够在降低成本的同时,扩大审计的覆盖范围。

技术框架:整体架构包括数据收集、视频内容标注、模型验证和结果分析四个主要模块。首先,通过虚假账户在TikTok上收集视频数据,然后利用MLLM进行内容标注,最后对标注结果进行分析和比较。

关键创新:最重要的技术创新在于将多模态语言模型应用于视频内容审计中,尤其是Gemini 2.5 Flash模型的使用,使得在成本和性能上均优于传统的本地视频审核方法。

关键设计:在模型设计中,采用了八帧采样和文本信息结合的方式,优化了标注的准确性。实验中使用的损失函数和参数设置经过精心调整,以确保模型在不同语言和文化背景下的适应性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,关键词搜索返回的有害内容比例为35-56%,相比于被动滚动基线,提升幅度为1.5-7.5倍。在十个国家-年龄组合中,意大利的19岁用户有害内容比例最高,达到48.6%。这些结果表明,基于多模态语言模型的审计方法在识别有害内容方面具有显著优势。

🎯 应用场景

该研究的潜在应用领域包括社交媒体平台的内容审核、青少年保护政策的制定以及跨国内容监管的标准化。通过提供一种可扩展的审计方法,能够有效提升平台对有害内容的识别和处理能力,从而保护年轻用户的安全。未来,该方法可能会影响政策制定者和平台运营者在内容管理方面的决策。

📄 摘要(原文)

Online video platforms can expose young users to harmful content, but independent audits remain difficult because video annotation is costly and moderation judgments vary across languages. We audit TikTok in France, Italy, and Sweden with sockpuppet accounts representing four age personas (13, 16, 19, 40), collecting 36,971 videos from passive For-You-page scrolling and active sessions that scroll, search for harm keywords, and scroll again. To scale annotation, we validate four multimodal LLMs against native-speaker labels on a 300-video reference set. Gemini 2.5 Flash with eight sampled frames plus text performs best (aggregate kappa = 0.42), at half the per-call cost of native-video upload, and we apply it to a 10% sample for approximately \$50 in total API spend across both modalities. Keyword search returns 35-56% harmful content, a 1.5-7.5x increase over the scrolling baseline in ten of twelve country-age combinations; the spike is temporary and flattens the age differences observed in France and Sweden. Under passive scrolling, Italy has the highest harm rate at every age, with Italian age-19 reaching 48.6%. Overall, MLLM-based auditing offers a scalable approach for cross-national youth-safety audits, while provider safety filters (1.1% refusal rate) under-count the most explicit harms.