Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Yuhui, Yu, Siyue, Yang, Yuxing, Cheng, Guangliang, Xiao, Jimin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hunyuan3D 1.0: A Unified Framework for Text-to-3D and Image-to-3D Generation
par: Yang, Xianghui, et autres
Publié: (2024)
par: Yang, Xianghui, et autres
Publié: (2024)
Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets
par: Hunyuan3D, Team, et autres
Publié: (2025)
par: Hunyuan3D, Team, et autres
Publié: (2025)
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
par: Zheng, Duo, et autres
Publié: (2025)
par: Zheng, Duo, et autres
Publié: (2025)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
par: Li, Fan, et autres
Publié: (2025)
par: Li, Fan, et autres
Publié: (2025)
LTM3D: Bridging Token Spaces for Conditional 3D Generation with Auto-Regressive Diffusion Framework
par: Kang, Xin, et autres
Publié: (2025)
par: Kang, Xin, et autres
Publié: (2025)
Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation
par: Ye, Chongjie, et autres
Publié: (2026)
par: Ye, Chongjie, et autres
Publié: (2026)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
par: Chen, Siyi, et autres
Publié: (2026)
par: Chen, Siyi, et autres
Publié: (2026)
Artifact Reduction in Undersampled 3D Cone-Beam CTs using a Hybrid 2D-3D CNN Framework
par: Thalhammer, Johannes, et autres
Publié: (2026)
par: Thalhammer, Johannes, et autres
Publié: (2026)
Multi-modal Relation Distillation for Unified 3D Representation Learning
par: Wang, Huiqun, et autres
Publié: (2024)
par: Wang, Huiqun, et autres
Publié: (2024)
IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs
par: Tan, Yifan, et autres
Publié: (2026)
par: Tan, Yifan, et autres
Publié: (2026)
Frequency-Aware Token Reduction for Efficient Vision Transformer
par: Lee, Dong-Jae, et autres
Publié: (2025)
par: Lee, Dong-Jae, et autres
Publié: (2025)
SC3D: Label-Efficient Outdoor 3D Object Detection via Single Click Annotation
par: Xia, Qiming, et autres
Publié: (2024)
par: Xia, Qiming, et autres
Publié: (2024)
Wonder3D++: Cross-domain Diffusion for High-fidelity 3D Generation from a Single Image
par: Yang, Yuxiao, et autres
Publié: (2025)
par: Yang, Yuxiao, et autres
Publié: (2025)
SSGaussian: Semantic-Aware and Structure-Preserving 3D Style Transfer
par: Xu, Jimin, et autres
Publié: (2025)
par: Xu, Jimin, et autres
Publié: (2025)
Mamba-3D as Masked Autoencoders for Accurate and Data-Efficient Analysis of Medical Ultrasound Videos
par: Zhou, Jiaheng, et autres
Publié: (2025)
par: Zhou, Jiaheng, et autres
Publié: (2025)
Ultra3D: Efficient and High-Fidelity 3D Generation with Part Attention
par: Chen, Yiwen, et autres
Publié: (2025)
par: Chen, Yiwen, et autres
Publié: (2025)
ForestFormer3D: A Unified Framework for End-to-End Segmentation of Forest LiDAR 3D Point Clouds
par: Xiang, Binbin, et autres
Publié: (2025)
par: Xiang, Binbin, et autres
Publié: (2025)
Event USKT : U-State Space Model in Knowledge Transfer for Event Cameras
par: Lin, Yuhui, et autres
Publié: (2024)
par: Lin, Yuhui, et autres
Publié: (2024)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
par: Jiang, Pengfei, et autres
Publié: (2025)
par: Jiang, Pengfei, et autres
Publié: (2025)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
par: Mao, Jiawei, et autres
Publié: (2025)
par: Mao, Jiawei, et autres
Publié: (2025)
Rethinking 3D Dense Caption and Visual Grounding in A Unified Framework through Prompt-based Localization
par: Luo, Yongdong, et autres
Publié: (2024)
par: Luo, Yongdong, et autres
Publié: (2024)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
par: Liu, Shengyuan, et autres
Publié: (2026)
par: Liu, Shengyuan, et autres
Publié: (2026)
S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance
par: Xu, Beining, et autres
Publié: (2025)
par: Xu, Beining, et autres
Publié: (2025)
Faster Parameter-Efficient Tuning with Token Redundancy Reduction
par: Kim, Kwonyoung, et autres
Publié: (2025)
par: Kim, Kwonyoung, et autres
Publié: (2025)
Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs
par: Feng, Yigui, et autres
Publié: (2026)
par: Feng, Yigui, et autres
Publié: (2026)
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
par: Li, Geng, et autres
Publié: (2026)
par: Li, Geng, et autres
Publié: (2026)
InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs
par: Tang, Lv, et autres
Publié: (2026)
par: Tang, Lv, et autres
Publié: (2026)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
par: Zhang, Qizhe, et autres
Publié: (2025)
par: Zhang, Qizhe, et autres
Publié: (2025)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
par: Li, Siyuan, et autres
Publié: (2025)
par: Li, Siyuan, et autres
Publié: (2025)
AdaTP: Attention-Debiased Token Pruning for Video Large Language Models
par: Sun, Fengyuan, et autres
Publié: (2025)
par: Sun, Fengyuan, et autres
Publié: (2025)
HY3D-Bench: Generation of 3D Assets
par: Hunyuan3D, Team, et autres
Publié: (2026)
par: Hunyuan3D, Team, et autres
Publié: (2026)
2D-3D Interlaced Transformer for Point Cloud Segmentation with Scene-Level Supervision
par: Yang, Cheng-Kun, et autres
Publié: (2023)
par: Yang, Cheng-Kun, et autres
Publié: (2023)
From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction
par: Han, Gaoge, et autres
Publié: (2025)
par: Han, Gaoge, et autres
Publié: (2025)
UniBEVFusion: Unified Radar-Vision BEVFusion for 3D Object Detection
par: Zhao, Haocheng, et autres
Publié: (2024)
par: Zhao, Haocheng, et autres
Publié: (2024)
Pandora3D: A Comprehensive Framework for High-Quality 3D Shape and Texture Generation
par: Yang, Jiayu, et autres
Publié: (2025)
par: Yang, Jiayu, et autres
Publié: (2025)
Unifying 2D and 3D Vision-Language Understanding
par: Jain, Ayush, et autres
Publié: (2025)
par: Jain, Ayush, et autres
Publié: (2025)
Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose Estimation
par: Li, Wenhao, et autres
Publié: (2023)
par: Li, Wenhao, et autres
Publié: (2023)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
Reinforced Embodied Active Defense: Exploiting Adaptive Interaction for Robust Visual Perception in Adversarial 3D Environments
par: Yang, Xiao, et autres
Publié: (2025)
par: Yang, Xiao, et autres
Publié: (2025)
UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation
par: Wu, Guanjun, et autres
Publié: (2025)
par: Wu, Guanjun, et autres
Publié: (2025)
Documents similaires
-
Hunyuan3D 1.0: A Unified Framework for Text-to-3D and Image-to-3D Generation
par: Yang, Xianghui, et autres
Publié: (2024) -
Hunyuan3D-Omni: A Unified Framework for Controllable Generation of 3D Assets
par: Hunyuan3D, Team, et autres
Publié: (2025) -
Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
par: Zheng, Duo, et autres
Publié: (2025) -
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
par: Li, Fan, et autres
Publié: (2025) -
LTM3D: Bridging Token Spaces for Conditional 3D Generation with Auto-Regressive Diffusion Framework
par: Kang, Xin, et autres
Publié: (2025)