Optimizing Dense Visual Predictions Through Multi-Task Coherence and Prioritization
Fuente:
arXiv
Saved in:
| Main Authors: | Fontana, Maxime, Spratling, Michael, Shi, Miaojing |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
When Multi-Task Learning Meets Partial Supervision: A Computer Vision Review
by: Fontana, Maxime, et al.
Published: (2023)
by: Fontana, Maxime, et al.
Published: (2023)
FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection
by: Fontana, Maxime, et al.
Published: (2026)
by: Fontana, Maxime, et al.
Published: (2026)
AROID: Improving Adversarial Robustness Through Online Instance-Wise Data Augmentation
by: Li, Lin, et al.
Published: (2023)
by: Li, Lin, et al.
Published: (2023)
Memory-guided Network with Uncertainty-based Feature Augmentation for Few-shot Semantic Segmentation
by: Chen, Xinyue, et al.
Published: (2024)
by: Chen, Xinyue, et al.
Published: (2024)
Visual Self-supervised Learning Scheme for Dense Prediction Tasks on X-ray Images
by: Halat, Shervin, et al.
Published: (2023)
by: Halat, Shervin, et al.
Published: (2023)
One Prompt Word is Enough to Boost Adversarial Robustness for Pre-trained Vision-Language Models
by: Li, Lin, et al.
Published: (2024)
by: Li, Lin, et al.
Published: (2024)
MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based Decoders
by: Lin, Baijiong, et al.
Published: (2024)
by: Lin, Baijiong, et al.
Published: (2024)
Single-Input Multi-Output Model Merging: Leveraging Foundation Models for Dense Multi-Task Learning
by: Giraldo, Juan Garcia, et al.
Published: (2025)
by: Giraldo, Juan Garcia, et al.
Published: (2025)
MTMamba++: Enhancing Multi-Task Dense Scene Understanding via Mamba-Based Decoders
by: Lin, Baijiong, et al.
Published: (2024)
by: Lin, Baijiong, et al.
Published: (2024)
Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment
by: Xiao, Xin, et al.
Published: (2024)
by: Xiao, Xin, et al.
Published: (2024)
STANCE: Motion Coherent Video Generation Via Sparse-to-Dense Anchored Encoding
by: Chen, Zhifei, et al.
Published: (2025)
by: Chen, Zhifei, et al.
Published: (2025)
Progressive Language-guided Visual Learning for Multi-Task Visual Grounding
by: Wang, Jingchao, et al.
Published: (2025)
by: Wang, Jingchao, et al.
Published: (2025)
VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes
by: Chen, Jingru, et al.
Published: (2026)
by: Chen, Jingru, et al.
Published: (2026)
On The Coherence of Quantitative Evaluation of Visual Explanations
by: Vandersmissen, Benjamin, et al.
Published: (2023)
by: Vandersmissen, Benjamin, et al.
Published: (2023)
Frequency Dynamic Convolution for Dense Image Prediction
by: Chen, Linwei, et al.
Published: (2025)
by: Chen, Linwei, et al.
Published: (2025)
Frequency-Dynamic Attention Modulation for Dense Prediction
by: Chen, Linwei, et al.
Published: (2025)
by: Chen, Linwei, et al.
Published: (2025)
Coherent Zero-Shot Visual Instruction Generation
by: Phung, Quynh, et al.
Published: (2024)
by: Phung, Quynh, et al.
Published: (2024)
MuDreamer: Learning Predictive World Models without Reconstruction
by: Burchi, Maxime, et al.
Published: (2024)
by: Burchi, Maxime, et al.
Published: (2024)
EMT: A Visual Multi-Task Benchmark Dataset for Autonomous Driving
by: Madjid, Nadya Abdel, et al.
Published: (2025)
by: Madjid, Nadya Abdel, et al.
Published: (2025)
Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning
by: Li, Changlin, et al.
Published: (2025)
by: Li, Changlin, et al.
Published: (2025)
Frequency-aware Feature Fusion for Dense Image Prediction
by: Chen, Linwei, et al.
Published: (2024)
by: Chen, Linwei, et al.
Published: (2024)
Beyond Perception: Evaluating Abstract Visual Reasoning through Multi-Stage Task
by: Jiang, Yanbei, et al.
Published: (2025)
by: Jiang, Yanbei, et al.
Published: (2025)
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning
by: Shi, Fan, et al.
Published: (2025)
by: Shi, Fan, et al.
Published: (2025)
Simplifying Multi-Task Architectures Through Task-Specific Normalization
by: Suteu, Mihai, et al.
Published: (2025)
by: Suteu, Mihai, et al.
Published: (2025)
SemCo: Toward Semantic Coherent Visual Relationship Forecasting
by: Ou, Yangjun, et al.
Published: (2021)
by: Ou, Yangjun, et al.
Published: (2021)
Progressive Homeostatic and Plastic Prompt Tuning for Audio-Visual Multi-Task Incremental Learning
by: Yin, Jiong, et al.
Published: (2025)
by: Yin, Jiong, et al.
Published: (2025)
Generalizing Consistency Policy to Visual RL with Prioritized Proximal Experience Regularization
by: Li, Haoran, et al.
Published: (2024)
by: Li, Haoran, et al.
Published: (2024)
DenseMLLM: Standard Multimodal LLMs for Dense Prediction
by: Li, Yi, et al.
Published: (2026)
by: Li, Yi, et al.
Published: (2026)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
by: Zhang, Jesen, et al.
Published: (2025)
by: Zhang, Jesen, et al.
Published: (2025)
DenseMTL: Cross-task Attention Mechanism for Dense Multi-task Learning
by: Lopes, Ivan, et al.
Published: (2022)
by: Lopes, Ivan, et al.
Published: (2022)
UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards
by: Wang, Jun, et al.
Published: (2026)
by: Wang, Jun, et al.
Published: (2026)
Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models
by: Zhou, Zijie, et al.
Published: (2026)
by: Zhou, Zijie, et al.
Published: (2026)
Hybrid Dense-UNet201 Optimization for Pap Smear Image Segmentation Using Spider Monkey Optimization
by: Khozaimi, Ach, et al.
Published: (2025)
by: Khozaimi, Ach, et al.
Published: (2025)
Show, Tell and Summarize: Dense Video Captioning Using Visual Cue Aided Sentence Summarization
by: Zhang, Zhiwang, et al.
Published: (2025)
by: Zhang, Zhiwang, et al.
Published: (2025)
A3-FPN: Asymptotic Content-Aware Pyramid Attention Network for Dense Visual Prediction
by: Qin, Meng'en, et al.
Published: (2026)
by: Qin, Meng'en, et al.
Published: (2026)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
by: Chen, Jiankang, et al.
Published: (2025)
by: Chen, Jiankang, et al.
Published: (2025)
Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning
by: Li, Xuchen, et al.
Published: (2025)
by: Li, Xuchen, et al.
Published: (2025)
$\mathrm{D}^\mathrm{3}$-Predictor: Noise-Free Deterministic Diffusion for Dense Prediction
by: Xia, Changliang, et al.
Published: (2025)
by: Xia, Changliang, et al.
Published: (2025)
1%>100%: High-Efficiency Visual Adapter with Complex Linear Projection Optimization
by: Yin, Dongshuo, et al.
Published: (2026)
by: Yin, Dongshuo, et al.
Published: (2026)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
by: Shi, Xinrui, et al.
Published: (2026)
by: Shi, Xinrui, et al.
Published: (2026)
Similar Items
-
When Multi-Task Learning Meets Partial Supervision: A Computer Vision Review
by: Fontana, Maxime, et al.
Published: (2023) -
FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection
by: Fontana, Maxime, et al.
Published: (2026) -
AROID: Improving Adversarial Robustness Through Online Instance-Wise Data Augmentation
by: Li, Lin, et al.
Published: (2023) -
Memory-guided Network with Uncertainty-based Feature Augmentation for Few-shot Semantic Segmentation
by: Chen, Xinyue, et al.
Published: (2024) -
Visual Self-supervised Learning Scheme for Dense Prediction Tasks on X-ray Images
by: Halat, Shervin, et al.
Published: (2023)