Multimodal Machine Translation with Visual Scene Graph Pruning
Fuente:
arXiv
Saved in:
| Main Authors: | Lu, Chenyu, Sun, Shiliang, Zhao, Jing, Zhang, Nan, Song, Tengfei, Yang, Hao |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
by: Wang, Chuhan, et al.
Published: (2026)
by: Wang, Chuhan, et al.
Published: (2026)
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
by: Alvar, Saeed Ranjbar, et al.
Published: (2025)
by: Alvar, Saeed Ranjbar, et al.
Published: (2025)
Targeted Therapy in Data Removal: Object Unlearning Based on Scene Graphs
by: Zhang, Chenhan, et al.
Published: (2024)
by: Zhang, Chenhan, et al.
Published: (2024)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
by: Zhang, Dingkun, et al.
Published: (2026)
by: Zhang, Dingkun, et al.
Published: (2026)
Multimodal Reference Visual Grounding
by: Lu, Yangxiao, et al.
Published: (2025)
by: Lu, Yangxiao, et al.
Published: (2025)
Anti-Forgetting Adaptation for Unsupervised Person Re-identification
by: Chen, Hao, et al.
Published: (2024)
by: Chen, Hao, et al.
Published: (2024)
SCENIR: Visual Semantic Clarity through Unsupervised Scene Graph Retrieval
by: Chaidos, Nikolaos, et al.
Published: (2025)
by: Chaidos, Nikolaos, et al.
Published: (2025)
Distilled Prompt Learning for Incomplete Multimodal Survival Prediction
by: Xu, Yingxue, et al.
Published: (2025)
by: Xu, Yingxue, et al.
Published: (2025)
Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training
by: Gao, Ziqi, et al.
Published: (2024)
by: Gao, Ziqi, et al.
Published: (2024)
Reassessing Layer Pruning in LLMs: New Insights and Methods
by: Lu, Yao, et al.
Published: (2024)
by: Lu, Yao, et al.
Published: (2024)
Batch Loss Score for Dynamic Data Pruning
by: Zhou, Qing, et al.
Published: (2026)
by: Zhou, Qing, et al.
Published: (2026)
Pruning Self-attentions into Convolutional Layers in Single Path
by: He, Haoyu, et al.
Published: (2021)
by: He, Haoyu, et al.
Published: (2021)
Lumos : Empowering Multimodal LLMs with Scene Text Recognition
by: Shenoy, Ashish, et al.
Published: (2024)
by: Shenoy, Ashish, et al.
Published: (2024)
Multimodal-Guided Dynamic Dataset Pruning for Robust and Efficient Data-Centric Learning
by: Yang, Suorong, et al.
Published: (2025)
by: Yang, Suorong, et al.
Published: (2025)
AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
by: Baek, Changwoo, et al.
Published: (2026)
by: Baek, Changwoo, et al.
Published: (2026)
Large-scale Dataset Pruning with Dynamic Uncertainty
by: He, Muyang, et al.
Published: (2023)
by: He, Muyang, et al.
Published: (2023)
When Graph meets Multimodal: Benchmarking and Meditating on Multimodal Attributed Graphs Learning
by: Yan, Hao, et al.
Published: (2024)
by: Yan, Hao, et al.
Published: (2024)
TSP3D: Text-guided Sparse Voxel Pruning for Efficient 3D Visual Grounding
by: Guo, Wenxuan, et al.
Published: (2025)
by: Guo, Wenxuan, et al.
Published: (2025)
TESGNN: Temporal Equivariant Scene Graph Neural Networks for Efficient and Robust Multi-View 3D Scene Understanding
by: Pham, Quang P. M., et al.
Published: (2024)
by: Pham, Quang P. M., et al.
Published: (2024)
Unbiased Scene Graph Generation from Biased Training
by: Tang, Kaihua, et al.
Published: (2020)
by: Tang, Kaihua, et al.
Published: (2020)
Accelerating Non-Maximum Suppression: A Graph Theory Perspective
by: Si, King-Siong, et al.
Published: (2024)
by: Si, King-Siong, et al.
Published: (2024)
SeaMo: A Season-Aware Multimodal Foundation Model for Remote Sensing
by: Li, Xuyang, et al.
Published: (2024)
by: Li, Xuyang, et al.
Published: (2024)
EGTR: Extracting Graph from Transformer for Scene Graph Generation
by: Im, Jinbae, et al.
Published: (2024)
by: Im, Jinbae, et al.
Published: (2024)
NEURAL: Attention-Guided Pruning for Unified Multimodal Resource-Constrained Clinical Evaluation
by: Joshi, Devvrat, et al.
Published: (2025)
by: Joshi, Devvrat, et al.
Published: (2025)
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
by: Song, Jiafei, et al.
Published: (2026)
by: Song, Jiafei, et al.
Published: (2026)
LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning
by: Zhang, Mingyang, et al.
Published: (2023)
by: Zhang, Mingyang, et al.
Published: (2023)
Decay Pruning Method: Smooth Pruning With a Self-Rectifying Procedure
by: Yang, Minghao, et al.
Published: (2024)
by: Yang, Minghao, et al.
Published: (2024)
GraphDreamer: Compositional 3D Scene Synthesis from Scene Graphs
by: Gao, Gege, et al.
Published: (2023)
by: Gao, Gege, et al.
Published: (2023)
Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation
by: Lu, Junxin, et al.
Published: (2026)
by: Lu, Junxin, et al.
Published: (2026)
ESGNN: Towards Equivariant Scene Graph Neural Network for 3D Scene Understanding
by: Pham, Quang P. M., et al.
Published: (2024)
by: Pham, Quang P. M., et al.
Published: (2024)
Graph Neural Networks for Surgical Scene Segmentation
by: Li, Yihan, et al.
Published: (2025)
by: Li, Yihan, et al.
Published: (2025)
CORP: Closed-Form One-shot Representation-Preserving Structured Pruning for Transformers
by: Zhang, Boxiang, et al.
Published: (2026)
by: Zhang, Boxiang, et al.
Published: (2026)
Meta Pruning via Graph Metanetworks : A Universal Meta Learning Framework for Network Pruning
by: Liu, Yewei, et al.
Published: (2025)
by: Liu, Yewei, et al.
Published: (2025)
Exploring 3D Dataset Pruning
by: Zhao, Xiaohan, et al.
Published: (2026)
by: Zhao, Xiaohan, et al.
Published: (2026)
Better Together: Leveraging Unpaired Multimodal Data for Stronger Unimodal Models
by: Gupta, Sharut, et al.
Published: (2025)
by: Gupta, Sharut, et al.
Published: (2025)
Action-slot: Visual Action-centric Representations for Multi-label Atomic Activity Recognition in Traffic Scenes
by: Kung, Chi-Hsi, et al.
Published: (2023)
by: Kung, Chi-Hsi, et al.
Published: (2023)
Bootstraping Clustering of Gaussians for View-consistent 3D Scene Understanding
by: Zhang, Wenbo, et al.
Published: (2024)
by: Zhang, Wenbo, et al.
Published: (2024)
Contrastive Learning for Multimodal Human Activity Recognition with Limited Labeled Data
by: Jing, Long, et al.
Published: (2026)
by: Jing, Long, et al.
Published: (2026)
Dependency-Aware Discrete Diffusion for Scene Graph Generation
by: Rajagopalan, Rajalaxmi, et al.
Published: (2026)
by: Rajagopalan, Rajalaxmi, et al.
Published: (2026)
Salient Temporal Encoding for Dynamic Scene Graph Generation
by: Zhu, Zhihao
Published: (2025)
by: Zhu, Zhihao
Published: (2025)
Similar Items
-
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
by: Wang, Chuhan, et al.
Published: (2026) -
DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models
by: Alvar, Saeed Ranjbar, et al.
Published: (2025) -
Targeted Therapy in Data Removal: Object Unlearning Based on Scene Graphs
by: Zhang, Chenhan, et al.
Published: (2024) -
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
by: Zhang, Dingkun, et al.
Published: (2026) -
Multimodal Reference Visual Grounding
by: Lu, Yangxiao, et al.
Published: (2025)