3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Fan, Yijia, Zhang, Jusheng, Cai, Kaitong, Yang, Jing, Wang, Jian, Wang, Keze |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
CF-VLM:CounterFactual Vision-Language Fine-tuning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
OSC: Cognitive Orchestration through Dynamic Knowledge Alignment in Multi-Agent LLM Collaboration
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Causal Invariance and Counterfactual Learning Driven Cooperative Game for Multi-Label Classification
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
RaCoT: Plug-and-Play Contrastive Example Generation Mechanism for Enhanced LLM Reasoning Reliability
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
Learning Dynamics of VLM Finetuning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Agent-GSPO: Communication-Efficient Multi-Agent Systems via Group Sequence Policy Optimization
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
Kolmogorov-Arnold Fourier Networks
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
MAT-Agent: Adaptive Multi-Agent Training Optimization
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
DrDiff: Dynamic Routing Diffusion with Hierarchical Attention for Breaking the Efficiency-Quality Trade-off
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Cost-Effective Communication: An Auction-based Method for Language Agent Interaction
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
Guardian: Decoupling Exploration from Safety in Reinforcement Learning
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
PTTA: A Pure Text-to-Animation Framework for High-Quality Creation
von: Chen, Ruiqi, et al.
Veröffentlicht: (2025)
von: Chen, Ruiqi, et al.
Veröffentlicht: (2025)
Top-Down Semantic Refinement for Image Captioning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Backward-Friendly Optimization: Training Large Language Models with Approximate Gradients under Memory Constraints
von: Yang, Jing, et al.
Veröffentlicht: (2025)
von: Yang, Jing, et al.
Veröffentlicht: (2025)
RevFFN: Memory-Efficient Full-Parameter Fine-Tuning of Mixture-of-Experts LLMs with Reversible Blocks
von: Liu, Ningyuan, et al.
Veröffentlicht: (2025)
von: Liu, Ningyuan, et al.
Veröffentlicht: (2025)
Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Spectral Gating Networks
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
SirenPose: Dynamic Scene Reconstruction via Geometric Supervision
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
Process-of-Thought Reasoning for Videos
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction
von: Zhang, Jensen, et al.
Veröffentlicht: (2025)
von: Zhang, Jensen, et al.
Veröffentlicht: (2025)
Failure-Driven Workflow Refinement
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
KABB: Knowledge-Aware Bayesian Bandits for Dynamic Expert Coordination in Multi-Agent Systems
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE
von: Huang, Hejin, et al.
Veröffentlicht: (2026)
von: Huang, Hejin, et al.
Veröffentlicht: (2026)
GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
STORM: Search-Guided Generative World Models for Robotic Manipulation
von: Lin, Wenjun, et al.
Veröffentlicht: (2025)
von: Lin, Wenjun, et al.
Veröffentlicht: (2025)
Rational ANOVA Networks
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation
von: Wang, Yihao, et al.
Veröffentlicht: (2026)
von: Wang, Yihao, et al.
Veröffentlicht: (2026)
CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation
von: Zeng, Qinglin, et al.
Veröffentlicht: (2025)
von: Zeng, Qinglin, et al.
Veröffentlicht: (2025)
AgriWorld:A World Tools Protocol Framework for Verifiable Agricultural Reasoning with Code-Executing LLM Agents
von: Zhang, Zhixing, et al.
Veröffentlicht: (2026)
von: Zhang, Zhixing, et al.
Veröffentlicht: (2026)
HiVA: Self-organized Hierarchical Variable Agent via Goal-driven Semantic-Topological Evolution
von: Tang, Jinzhou, et al.
Veröffentlicht: (2025)
von: Tang, Jinzhou, et al.
Veröffentlicht: (2025)
Self-Rewarded Multimodal Coherent Reasoning Across Diverse Visual Domains
von: Zhang, Jesen, et al.
Veröffentlicht: (2025)
von: Zhang, Jesen, et al.
Veröffentlicht: (2025)
A Scalable Curiosity-Driven Game-Theoretic Framework for Long-Tail Multi-Label Learning in Data Mining
von: Yang, Jing, et al.
Veröffentlicht: (2026)
von: Yang, Jing, et al.
Veröffentlicht: (2026)
From Motion to Behavior: Hierarchical Modeling of Humanoid Generative Behavior Control
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Adapted Center and Scale Prediction: More Stable and More Accurate
von: Wang, Wenhao, et al.
Veröffentlicht: (2020)
von: Wang, Wenhao, et al.
Veröffentlicht: (2020)
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
von: Yin, Hao, et al.
Veröffentlicht: (2025)
von: Yin, Hao, et al.
Veröffentlicht: (2025)
Hyperbolic Hierarchical Alignment Reasoning Network for Text-3D Retrieval
von: Li, Wenrui, et al.
Veröffentlicht: (2025)
von: Li, Wenrui, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
CF-VLM:CounterFactual Vision-Language Fine-tuning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025) -
OSC: Cognitive Orchestration through Dynamic Knowledge Alignment in Multi-Agent LLM Collaboration
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025) -
Causal Invariance and Counterfactual Learning Driven Cooperative Game for Multi-Label Classification
von: Fan, Yijia, et al.
Veröffentlicht: (2025) -
RaCoT: Plug-and-Play Contrastive Example Generation Mechanism for Enhanced LLM Reasoning Reliability
von: Cai, Kaitong, et al.
Veröffentlicht: (2025) -
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)