Astrea: A MOE-based Visual Understanding Model with Progressive Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Xiaoda, Lu, JunYu, Qiu, Hongshun, Li, Sijing, Li, Hao, Ji, Shengpeng, Tang, Xudong, Xu, Jiayang, Duan, Jiaqi, Jiang, Ziyue, Lin, Cong, Cai, Sihang, Xie, Zejian, Song, Zhuoyang, Zhang, Songxin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
por: Lu, Junyu, et al.
Publicado: (2023)
por: Lu, Junyu, et al.
Publicado: (2023)
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
por: Lu, Junyu, et al.
Publicado: (2025)
por: Lu, Junyu, et al.
Publicado: (2025)
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
por: Zuo, Jialong, et al.
Publicado: (2025)
por: Zuo, Jialong, et al.
Publicado: (2025)
PVI: Plug-in Visual Injection for Vision-Language-Action Models
por: Zhang, Zezhou, et al.
Publicado: (2026)
por: Zhang, Zezhou, et al.
Publicado: (2026)
OmniCam: Unified Multimodal Video Generation via Camera Control
por: Yang, Xiaoda, et al.
Publicado: (2025)
por: Yang, Xiaoda, et al.
Publicado: (2025)
MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis
por: Jiang, Ziyue, et al.
Publicado: (2025)
por: Jiang, Ziyue, et al.
Publicado: (2025)
L0: Reinforcement Learning to Become General Agents
por: Zhang, Junjie, et al.
Publicado: (2025)
por: Zhang, Junjie, et al.
Publicado: (2025)
BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training
por: Sun, Ting, et al.
Publicado: (2026)
por: Sun, Ting, et al.
Publicado: (2026)
MOE-Enhanced Explanable Deep Manifold Transformation for Complex Data Embedding and Visualization
por: Zang, Zelin, et al.
Publicado: (2024)
por: Zang, Zelin, et al.
Publicado: (2024)
Exploring Learning Complexity for Efficient Downstream Dataset Pruning
por: Jiang, Wenyu, et al.
Publicado: (2024)
por: Jiang, Wenyu, et al.
Publicado: (2024)
ProgressGym: Alignment with a Millennium of Moral Progress
por: Qiu, Tianyi, et al.
Publicado: (2024)
por: Qiu, Tianyi, et al.
Publicado: (2024)
Le metamorfosi di Astrea
por: Guerrini, Maria Teresa
Publicado: (2025)
por: Guerrini, Maria Teresa
Publicado: (2025)
MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
MuVi: Video-to-Music Generation with Semantic Alignment and Rhythmic Synchronization
por: Li, Ruiqi, et al.
Publicado: (2024)
por: Li, Ruiqi, et al.
Publicado: (2024)
View Distribution Alignment with Progressive Adversarial Learning for UAV Visual Geo-Localization
por: Liu, Cuiwei, et al.
Publicado: (2024)
por: Liu, Cuiwei, et al.
Publicado: (2024)
TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models
por: Ji, Shengpeng, et al.
Publicado: (2023)
por: Ji, Shengpeng, et al.
Publicado: (2023)
AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding
por: Chowdhury, Sanjoy, et al.
Publicado: (2025)
por: Chowdhury, Sanjoy, et al.
Publicado: (2025)
EyecareGPT: Boosting Comprehensive Ophthalmology Understanding with Tailored Dataset, Benchmark and Model
por: Li, Sijing, et al.
Publicado: (2025)
por: Li, Sijing, et al.
Publicado: (2025)
Routing Manifold Alignment Improves Generalization of Mixture-of-Experts LLMs
por: Li, Zhongyang, et al.
Publicado: (2025)
por: Li, Zhongyang, et al.
Publicado: (2025)
ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding
por: Kong, Quan, et al.
Publicado: (2026)
por: Kong, Quan, et al.
Publicado: (2026)
The Partition Principle Revisited: Non-Equal Volume Designs Achieve Minimal Expected Star Discrepancy
por: Xu, Xiaoda
Publicado: (2026)
por: Xu, Xiaoda
Publicado: (2026)
Weighted $L_p$-Discrepancy Bounds for Parametric Stratified Sampling and Applications to High-Dimensional Integration
por: Xu, Xiaoda
Publicado: (2025)
por: Xu, Xiaoda
Publicado: (2025)
Confidence Freeze: Early Success Induces a Metastable Decoupling of Metacognition and Behaviour
por: Zhang, Zhipeng, et al.
Publicado: (2026)
por: Zhang, Zhipeng, et al.
Publicado: (2026)
Conclusive exclusion of quantum states with group action
por: Yao, Hongshun, et al.
Publicado: (2025)
por: Yao, Hongshun, et al.
Publicado: (2025)
Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models
por: Wang, Wei, et al.
Publicado: (2024)
por: Wang, Wei, et al.
Publicado: (2024)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
por: Zhang, Zhixiong, et al.
Publicado: (2025)
por: Zhang, Zhixiong, et al.
Publicado: (2025)
Speech Watermarking with Discrete Intermediate Representations
por: Ji, Shengpeng, et al.
Publicado: (2024)
por: Ji, Shengpeng, et al.
Publicado: (2024)
Optimal plug-in Gaussian processes for modeling derivatives
por: Liu, Zejian, et al.
Publicado: (2022)
por: Liu, Zejian, et al.
Publicado: (2022)
Mixed-Criticality Flow Scheduling with Low Delay and Limited Bandwidth in TSN
por: Yan, Wenyan, et al.
Publicado: (2026)
por: Yan, Wenyan, et al.
Publicado: (2026)
ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search
por: Xie, Zequn, et al.
Publicado: (2026)
por: Xie, Zequn, et al.
Publicado: (2026)
Boosting Scientific Concepts Understanding: Can Analogy from Teacher Models Empower Student Models?
por: Yuan, Siyu, et al.
Publicado: (2024)
por: Yuan, Siyu, et al.
Publicado: (2024)
EEVS: Monocular End‐Effector Pose Estimation‐Based Visual Servoing Against Uncertainties
por: Ze'an Liu, et al.
Publicado: (2025)
por: Ze'an Liu, et al.
Publicado: (2025)
BiSpikCLM: A Spiking Language Model integrating Softmax-Free Spiking Attention and Spike-Aware Alignment Distillation
por: Guo, Sihang, et al.
Publicado: (2026)
por: Guo, Sihang, et al.
Publicado: (2026)
Ultrasound Vision-Language Alignment via Contrastive Learning
por: Lyu, Zhuoyang, et al.
Publicado: (2026)
por: Lyu, Zhuoyang, et al.
Publicado: (2026)
Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic Space
por: Fu, Xingcheng, et al.
Publicado: (2026)
por: Fu, Xingcheng, et al.
Publicado: (2026)
Topology Optimization Design of Automotive Suspension Control Arm
por: Rongfeng Lin, et al.
Publicado: (2025)
por: Rongfeng Lin, et al.
Publicado: (2025)
LoMOE: Localized Multi-Object Editing via Multi-Diffusion
por: Chakrabarty, Goirik, et al.
Publicado: (2024)
por: Chakrabarty, Goirik, et al.
Publicado: (2024)
Effective Universal Unrestricted Adversarial Attacks using a MOE Approach
por: Baia, A. E., et al.
Publicado: (2021)
por: Baia, A. E., et al.
Publicado: (2021)
EENY, MEENY, MINY, MOE: THE RECEPTION OF RETRANSLATIONS AND HOW READERS CHOOSE
por: Mary Wardle
Publicado: (2019)
por: Mary Wardle
Publicado: (2019)
Progress on the Mechanisms and Neuroprotective Benefits of Dexmedetomidine in Brain Diseases
por: Zhenxing Tao, et al.
Publicado: (2024)
por: Zhenxing Tao, et al.
Publicado: (2024)
Ejemplares similares
-
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
por: Lu, Junyu, et al.
Publicado: (2023) -
Orcust: Stepwise-Feedback Reinforcement Learning for GUI Agent
por: Lu, Junyu, et al.
Publicado: (2025) -
Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching
por: Zuo, Jialong, et al.
Publicado: (2025) -
PVI: Plug-in Visual Injection for Vision-Language-Action Models
por: Zhang, Zezhou, et al.
Publicado: (2026) -
OmniCam: Unified Multimodal Video Generation via Camera Control
por: Yang, Xiaoda, et al.
Publicado: (2025)