Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Zizhao, Wei, Ping, Ren, Ziyang, Li, Huan, Yin, Xiangru |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Task-Driven Exploration: Decoupling and Inter-Task Feedback for Joint Moment Retrieval and Highlight Detection
par: Yang, Jin, et autres
Publié: (2024)
par: Yang, Jin, et autres
Publié: (2024)
An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2024)
par: Hu, Zizhao, et autres
Publié: (2024)
Beyond Words: Multimodal LLM Knows When to Speak
par: Liao, Zikai, et autres
Publié: (2025)
par: Liao, Zikai, et autres
Publié: (2025)
Moondream Segmentation: From Words to Masks
par: Reid, Ethan
Publié: (2026)
par: Reid, Ethan
Publié: (2026)
Reasoning-Aware Multimodal Fusion for Hateful Video Detection
par: Yang, Shuonan, et autres
Publié: (2025)
par: Yang, Shuonan, et autres
Publié: (2025)
From Pixels to Words -- Towards Native Vision-Language Primitives at Scale
par: Diao, Haiwen, et autres
Publié: (2025)
par: Diao, Haiwen, et autres
Publié: (2025)
MaskAdapt: Unsupervised Geometry-Aware Domain Adaptation Using Multimodal Contextual Learning and RGB-Depth Masking
par: Nadeem, Numair, et autres
Publié: (2025)
par: Nadeem, Numair, et autres
Publié: (2025)
Bridging Data Islands: Geographic Heterogeneity-Aware Federated Learning for Collaborative Remote Sensing Semantic Segmentation
par: Tan, Jieyi, et autres
Publié: (2024)
par: Tan, Jieyi, et autres
Publié: (2024)
LIDAR: Lightweight Adaptive Cue-Aware Fusion Vision Mamba for Multimodal Segmentation of Structural Cracks
par: Liu, Hui, et autres
Publié: (2025)
par: Liu, Hui, et autres
Publié: (2025)
Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications
par: Rahman, Ben
Publié: (2025)
par: Rahman, Ben
Publié: (2025)
Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models
par: Han, Tianyang, et autres
Publié: (2025)
par: Han, Tianyang, et autres
Publié: (2025)
Towards Efficient Pixel Labeling for Industrial Anomaly Detection and Localization
par: Wu, Jingqi, et autres
Publié: (2025)
par: Wu, Jingqi, et autres
Publié: (2025)
Semantic Causality-Aware Vision-Based 3D Occupancy Prediction
par: Chen, Dubing, et autres
Publié: (2025)
par: Chen, Dubing, et autres
Publié: (2025)
GLaMM: Pixel Grounding Large Multimodal Model
par: Rasheed, Hanoona, et autres
Publié: (2023)
par: Rasheed, Hanoona, et autres
Publié: (2023)
PixelBytes: Catching Unified Representation for Multimodal Generation
par: Furfaro, Fabien
Publié: (2024)
par: Furfaro, Fabien
Publié: (2024)
Pixel-Grounded Retrieval for Knowledgeable Large Multimodal Models
par: Kim, Jeonghwan, et autres
Publié: (2026)
par: Kim, Jeonghwan, et autres
Publié: (2026)
PixelBytes: Catching Unified Embedding for Multimodal Generation
par: Furfaro, Fabien
Publié: (2024)
par: Furfaro, Fabien
Publié: (2024)
AlterMOMA: Fusion Redundancy Pruning for Camera-LiDAR Fusion Models with Alternative Modality Masking
par: Sun, Shiqi, et autres
Publié: (2024)
par: Sun, Shiqi, et autres
Publié: (2024)
Local and Global Feature Attention Fusion Network for Face Recognition
par: Yu, Wang, et autres
Publié: (2024)
par: Yu, Wang, et autres
Publié: (2024)
Layer-Wise Feature Metric of Semantic-Pixel Matching for Few-Shot Learning
par: Tang, Hao, et autres
Publié: (2024)
par: Tang, Hao, et autres
Publié: (2024)
Hierarchical Deep Fusion Framework for Multi-dimensional Facial Forgery Detection -- The 2024 Global Deepfake Image Detection Challenge
par: Wang, Kohou, et autres
Publié: (2025)
par: Wang, Kohou, et autres
Publié: (2025)
Semantic Manipulation Localization
par: Tan, Zhenshan, et autres
Publié: (2026)
par: Tan, Zhenshan, et autres
Publié: (2026)
BiCo-Fusion: Bidirectional Complementary LiDAR-Camera Fusion for Semantic- and Spatial-Aware 3D Object Detection
par: Song, Yang, et autres
Publié: (2024)
par: Song, Yang, et autres
Publié: (2024)
The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents
par: Sun, Yuwei, et autres
Publié: (2026)
par: Sun, Yuwei, et autres
Publié: (2026)
GateFuseNet: An Adaptive 3D Multimodal Neuroimaging Fusion Network for Parkinson's Disease Diagnosis
par: Jin, Rui, et autres
Publié: (2025)
par: Jin, Rui, et autres
Publié: (2025)
TextSplat: Text-Guided Semantic Fusion for Generalizable Gaussian Splatting
par: Wu, Zhicong, et autres
Publié: (2025)
par: Wu, Zhicong, et autres
Publié: (2025)
Exploring the Limits of Semantic Image Compression at Micro-bits per Pixel
par: Dotzel, Jordan, et autres
Publié: (2024)
par: Dotzel, Jordan, et autres
Publié: (2024)
SafePLUG: Empowering Multimodal LLMs with Pixel-Level Insight and Temporal Grounding for Traffic Accident Understanding
par: Sheng, Zihao, et autres
Publié: (2025)
par: Sheng, Zihao, et autres
Publié: (2025)
SIDA: Social Media Image Deepfake Detection, Localization and Explanation with Large Multimodal Model
par: Huang, Zhenglin, et autres
Publié: (2024)
par: Huang, Zhenglin, et autres
Publié: (2024)
From Pixels to Components: Eigenvector Masking for Visual Representation Learning
par: Bizeul, Alice, et autres
Publié: (2025)
par: Bizeul, Alice, et autres
Publié: (2025)
AMI-Net: Adaptive Mask Inpainting Network for Industrial Anomaly Detection and Localization
par: Luo, Wei, et autres
Publié: (2024)
par: Luo, Wei, et autres
Publié: (2024)
Environment-Aware Channel Prediction for Vehicular Communications: A Multimodal Visual Feature Fusion Framework
par: Zhang, Xuejian, et autres
Publié: (2026)
par: Zhang, Xuejian, et autres
Publié: (2026)
A-MESS: Anchor based Multimodal Embedding with Semantic Synchronization for Multimodal Intent Recognition
par: Shen, Yaomin, et autres
Publié: (2025)
par: Shen, Yaomin, et autres
Publié: (2025)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
par: Wang, Haozhe, et autres
Publié: (2025)
par: Wang, Haozhe, et autres
Publié: (2025)
Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization
par: Jiang, Yuanyuan, et autres
Publié: (2022)
par: Jiang, Yuanyuan, et autres
Publié: (2022)
Humor in Pixels: Benchmarking Large Multimodal Models Understanding of Online Comics
par: Ryan, Yuriel, et autres
Publié: (2025)
par: Ryan, Yuriel, et autres
Publié: (2025)
Semantic Is Enough: Only Semantic Information For NeRF Reconstruction
par: Wang, Ruibo, et autres
Publié: (2024)
par: Wang, Ruibo, et autres
Publié: (2024)
ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation
par: Mai, Ziyang, et autres
Publié: (2025)
par: Mai, Ziyang, et autres
Publié: (2025)
VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging
par: Zhong, Ming, et autres
Publié: (2025)
par: Zhong, Ming, et autres
Publié: (2025)
Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine
par: Huang, Xiaoshuang, et autres
Publié: (2024)
par: Huang, Xiaoshuang, et autres
Publié: (2024)
Documents similaires
-
Task-Driven Exploration: Decoupling and Inter-Task Feedback for Joint Moment Retrieval and Highlight Detection
par: Yang, Jin, et autres
Publié: (2024) -
An Intermediate Fusion ViT Enables Efficient Text-Image Alignment in Diffusion Models
par: Hu, Zizhao, et autres
Publié: (2024) -
Beyond Words: Multimodal LLM Knows When to Speak
par: Liao, Zikai, et autres
Publié: (2025) -
Moondream Segmentation: From Words to Masks
par: Reid, Ethan
Publié: (2026) -
Reasoning-Aware Multimodal Fusion for Hateful Video Detection
par: Yang, Shuonan, et autres
Publié: (2025)