SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tong, Jintao, Yan, Shilin, Xue, Hongwei, Tang, Xiaojun, Shi, Kunyu, Zhang, Guannan, Li, Ruixuan, Zou, Yixiong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
par: Yan, Shilin, et autres
Publié: (2026)
par: Yan, Shilin, et autres
Publié: (2026)
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
par: Tong, Jintao, et autres
Publié: (2025)
par: Tong, Jintao, et autres
Publié: (2025)
Lightweight Frequency Masker for Cross-Domain Few-Shot Semantic Segmentation
par: Tong, Jintao, et autres
Publié: (2024)
par: Tong, Jintao, et autres
Publié: (2024)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
Self-Disentanglement and Re-Composition for Cross-Domain Few-Shot Segmentation
par: Tong, Jintao, et autres
Publié: (2025)
par: Tong, Jintao, et autres
Publié: (2025)
Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes
par: Li, Pengxiang, et autres
Publié: (2026)
par: Li, Pengxiang, et autres
Publié: (2026)
Adapter Naturally Serves as Decoupler for Cross-Domain Few-Shot Semantic Segmentation
par: Tong, Jintao, et autres
Publié: (2025)
par: Tong, Jintao, et autres
Publié: (2025)
Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning
par: Yi, Shuai, et autres
Publié: (2026)
par: Yi, Shuai, et autres
Publié: (2026)
Revisiting Continuity of Image Tokens for Cross-domain Few-shot Learning
par: Yi, Shuai, et autres
Publié: (2025)
par: Yi, Shuai, et autres
Publié: (2025)
Revisiting Pool-based Prompt Learning for Few-shot Class-incremental Learning
par: Jiang, Yongwei, et autres
Publié: (2025)
par: Jiang, Yongwei, et autres
Publié: (2025)
Reconstruction Target Matters in Masked Image Modeling for Cross-Domain Few-Shot Learning
par: Ma, Ran, et autres
Publié: (2024)
par: Ma, Ran, et autres
Publié: (2024)
Random Registers for Cross-Domain Few-Shot Learning
par: Yi, Shuai, et autres
Publié: (2025)
par: Yi, Shuai, et autres
Publié: (2025)
Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection
par: Jiang, Yongwei, et autres
Publié: (2026)
par: Jiang, Yongwei, et autres
Publié: (2026)
Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning
par: Yi, Shuai, et autres
Publié: (2026)
par: Yi, Shuai, et autres
Publié: (2026)
FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
par: Tong, Jintao, et autres
Publié: (2025)
par: Tong, Jintao, et autres
Publié: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
par: Zhang, Huanyu, et autres
Publié: (2025)
par: Zhang, Huanyu, et autres
Publié: (2025)
The Devil is in Low-Level Features for Cross-Domain Few-Shot Segmentation
par: Liu, Yuhan, et autres
Publié: (2025)
par: Liu, Yuhan, et autres
Publié: (2025)
Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment
par: Zhao, Yaze, et autres
Publié: (2026)
par: Zhao, Yaze, et autres
Publié: (2026)
Learning Unknowns from Unknowns: Diversified Negative Prototypes Generator for Few-Shot Open-Set Recognition
par: Zhang, Zhenyu, et autres
Publié: (2024)
par: Zhang, Zhenyu, et autres
Publié: (2024)
Math Blind: Failures in Diagram Understanding Undermine Reasoning in MLLMs
par: Sun, Yanpeng, et autres
Publié: (2025)
par: Sun, Yanpeng, et autres
Publié: (2025)
Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning
par: Zhang, Zhenyu, et autres
Publié: (2026)
par: Zhang, Zhenyu, et autres
Publié: (2026)
Flatten Long-Range Loss Landscapes for Cross-Domain Few-Shot Learning
par: Zou, Yixiong, et autres
Publié: (2024)
par: Zou, Yixiong, et autres
Publié: (2024)
Delve into Base-Novel Confusion: Redundancy Exploration for Few-Shot Class-Incremental Learning
par: Zhou, Haichen, et autres
Publié: (2024)
par: Zhou, Haichen, et autres
Publié: (2024)
Compositional Few-Shot Class-Incremental Learning
par: Zou, Yixiong, et autres
Publié: (2024)
par: Zou, Yixiong, et autres
Publié: (2024)
Reviving In-domain Fine-tuning Methods for Source-Free Cross-domain Few-shot Learning
par: Zhao, Yaze, et autres
Publié: (2026)
par: Zhao, Yaze, et autres
Publié: (2026)
E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs
par: Liu, Xianjie, et autres
Publié: (2026)
par: Liu, Xianjie, et autres
Publié: (2026)
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs
par: Wang, Haicheng, et autres
Publié: (2026)
par: Wang, Haicheng, et autres
Publié: (2026)
HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling
par: Liu, Xianjie, et autres
Publié: (2025)
par: Liu, Xianjie, et autres
Publié: (2025)
GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
par: Zheng, Guanghao, et autres
Publié: (2025)
par: Zheng, Guanghao, et autres
Publié: (2025)
MICM: Rethinking Unsupervised Pretraining for Enhanced Few-shot Learning
par: Zhang, Zhenyu, et autres
Publié: (2024)
par: Zhang, Zhenyu, et autres
Publié: (2024)
Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding
par: Yan, Qingyang, et autres
Publié: (2025)
par: Yan, Qingyang, et autres
Publié: (2025)
RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs
par: Lawrence, Logan, et autres
Publié: (2026)
par: Lawrence, Logan, et autres
Publié: (2026)
Speculative Decoding for Autoregressive Video Generation
par: Hu, Yuezhou, et autres
Publié: (2026)
par: Hu, Yuezhou, et autres
Publié: (2026)
Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs
par: Zhang, Shan, et autres
Publié: (2025)
par: Zhang, Shan, et autres
Publié: (2025)
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
par: Li, Qiaoru, et autres
Publié: (2026)
par: Li, Qiaoru, et autres
Publié: (2026)
AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process
par: Zhang, Xintong, et autres
Publié: (2026)
par: Zhang, Xintong, et autres
Publié: (2026)
Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis
par: Chen, Jintao, et autres
Publié: (2026)
par: Chen, Jintao, et autres
Publié: (2026)
Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
par: Chen, Ruoyu, et autres
Publié: (2025)
par: Chen, Ruoyu, et autres
Publié: (2025)
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs
par: Wu, Mingrui, et autres
Publié: (2025)
par: Wu, Mingrui, et autres
Publié: (2025)
AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs
par: Lu, Lidong, et autres
Publié: (2025)
par: Lu, Lidong, et autres
Publié: (2025)
Documents similaires
-
Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
par: Yan, Shilin, et autres
Publié: (2026) -
Sketch-in-Latents: Eliciting Unified Reasoning in MLLMs
par: Tong, Jintao, et autres
Publié: (2025) -
Lightweight Frequency Masker for Cross-Domain Few-Shot Semantic Segmentation
par: Tong, Jintao, et autres
Publié: (2024) -
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
par: Shen, Haozhan, et autres
Publié: (2026) -
Self-Disentanglement and Re-Composition for Cross-Domain Few-Shot Segmentation
par: Tong, Jintao, et autres
Publié: (2025)