GAN-Based Semantic Communication for Image Transmission in IoV

📄 arXiv: 2608.27989v1 📥 PDF

作者: Ruixing Ren, Shan Chen, Junhui Zhao, Xiaoke Sun

分类: cs.CV, eess.SY

发布日期: 2026-08-28

备注: 8 pages, 7 figures


💡 一句话要点

提出基于GAN的语义通信框架以提升车联网图像传输效率

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)

关键词: 生成对抗网络 语义通信 车联网 图像传输 视觉数据 深度学习 图像重建

📋 核心要点

  1. 现有的通信系统在有限带宽和动态信道条件下,无法有效传输视觉数据,导致效率和保真度不足。
  2. 提出的框架通过金字塔注意力网络提取语义信息,并引入语义优先级机制,以优化比特分配和损失函数设计。
  3. 实验结果显示,该方法在Cityscapes数据集上在语义分割和图像重建质量上均显著优于现有方法,且在不同信道条件下表现稳定。

📝 摘要(中文)

为了解决车联网中视觉数据传输的效率和保真度瓶颈,本文提出了一种基于生成对抗网络的语义通信框架。该框架在发送端采用金字塔注意力网络提取语义标签图,并引入语义优先级保留机制,根据驾驶安全性为不同语义类别分配差异化权重,指导比特分配和损失函数设计。在接收端,设计了一个图像重建模块,结合粗到细的多分辨率生成器和多尺度判别器,利用时间一致性分支、空间金字塔池化和类别感知卷积层,实现从损坏的语义标签中高保真重建高质量图像。实验结果表明,该方法在Cityscapes数据集上在语义分割精度和重建图像质量上均优于现有方法,并在AWGN和Rayleigh信道下保持稳定的重建性能。

🔬 方法详解

问题定义:本文旨在解决车联网中视觉数据传输的效率和保真度瓶颈。现有方法在有限带宽和动态信道条件下,无法有效处理视觉信息,导致传输质量下降。

核心思路:提出的框架基于生成对抗网络,通过金字塔注意力网络提取语义标签,并引入语义优先级保留机制,以优化比特分配和损失函数设计,从而提升图像重建的质量和效率。

技术框架:整体架构包括发送端和接收端两个主要模块。发送端使用金字塔注意力网络提取语义信息,并根据语义优先级进行比特分配;接收端则通过多分辨率生成器和多尺度判别器进行图像重建,结合时间一致性分支和空间金字塔池化技术。

关键创新:最重要的创新在于引入了语义优先级保留机制,使得不同语义类别在比特分配和损失函数设计中得到差异化处理,从而显著提升了重建图像的质量。

关键设计:在损失函数设计上,结合了对抗损失、特征匹配损失和感知损失,以增强生成图像的语义一致性和视觉真实感。同时,采用了类别感知卷积层和空间金字塔池化技术,以提升重建效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,提出的方法在Cityscapes数据集上实现了比现有方法更高的语义分割精度和图像重建质量,具体提升幅度达到XX%(具体数据未知),并在AWGN和Rayleigh信道下保持了稳定的重建性能。

🎯 应用场景

该研究的潜在应用领域包括智能交通系统、自动驾驶车辆的视觉感知和车联网中的实时数据传输。通过提升图像传输的效率和质量,可以为自动驾驶决策提供更可靠的视觉信息,进而提高行车安全性和交通管理的智能化水平。

📄 摘要(原文)

For cooperative perception in the internet of vehicles, this paper proposes a generative adversarial network-based semantic communication framework to address the efficiency and fidelity bottlenecks of traditional communication systems in visual data transmission under limited bandwidth and dynamic channel conditions. At the transmitter, the framework adopts a pyramid attention network to extract semantic label maps and introduces a semantic priority preservation mechanism. It assigns differentiated weights to distinct semantic categories based on driving safety, guiding bit allocation and loss function design. At the receiver, an image reconstruction module integrating a coarse to-fine multi-resolution generator and multi-scale discriminator is designed. Combined with the temporal consistency branch, spatial pyramid pooling and class-aware convolutional layers, it achieves high-fidelity reconstruction of high-quality images from corrupted semantic labels. The model is trained with combined adversarial, feature matching and perceptual losses, effectively improving semantic consistency and visual realism of generated images. Experimental results on the Cityscapes dataset show that the proposed method outperforms existing counterparts in both semantic segmentation accuracy and reconstructed image quality, and maintains stable reconstruction performance under AWGN and Rayleigh channels.