Guardado en:
| Autores principales: | Jia, Ziqi, Li, Junjie, Qu, Xiaoyang, Wang, Jianzong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2503.10049 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Hierarchical-Task-Aware Multi-modal Mixture of Incremental LoRA Experts for Embodied Continual Learning
por: Jia, Ziqi, et al.
Publicado: (2025)
por: Jia, Ziqi, et al.
Publicado: (2025)
CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control
por: Shi, Jiaqi, et al.
Publicado: (2026)
por: Shi, Jiaqi, et al.
Publicado: (2026)
DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement
por: Lu, Renjie, et al.
Publicado: (2026)
por: Lu, Renjie, et al.
Publicado: (2026)
Federated Domain Generalization with Domain-specific Soft Prompts Generation
por: Wu, Jianhan, et al.
Publicado: (2025)
por: Wu, Jianhan, et al.
Publicado: (2025)
RATE-Nav: Region-Aware Termination Enhancement for Zero-shot Object Navigation with Vision-Language Models
por: Li, Junjie, et al.
Publicado: (2025)
por: Li, Junjie, et al.
Publicado: (2025)
MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts
por: Tao, Wei, et al.
Publicado: (2025)
por: Tao, Wei, et al.
Publicado: (2025)
VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection
por: Zhang, Bin, et al.
Publicado: (2025)
por: Zhang, Bin, et al.
Publicado: (2025)
BAGNet: A Boundary-Aware Graph Attention Network for 3D Point Cloud Semantic Segmentation
por: Tao, Wei, et al.
Publicado: (2025)
por: Tao, Wei, et al.
Publicado: (2025)
WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization
por: Tao, Wei, et al.
Publicado: (2026)
por: Tao, Wei, et al.
Publicado: (2026)
MIRRORTALK: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control
por: Lu, Renjie, et al.
Publicado: (2026)
por: Lu, Renjie, et al.
Publicado: (2026)
From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration
por: Shi, Jiaqi, et al.
Publicado: (2026)
por: Shi, Jiaqi, et al.
Publicado: (2026)
PRENet: A Plane-Fit Redundancy Encoding Point Cloud Sequence Network for Real-Time 3D Action Recognition
por: He, Shenglin, et al.
Publicado: (2024)
por: He, Shenglin, et al.
Publicado: (2024)
VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success
por: Liu, Chuhang, et al.
Publicado: (2026)
por: Liu, Chuhang, et al.
Publicado: (2026)
ESARM: 3D Emotional Speech-to-Animation via Reward Model from Automatically-Ranked Demonstrations
por: Zhang, Xulong, et al.
Publicado: (2024)
por: Zhang, Xulong, et al.
Publicado: (2024)
RUNA: Object-level Out-of-Distribution Detection via Regional Uncertainty Alignment of Multimodal Representations
por: Zhang, Bin, et al.
Publicado: (2025)
por: Zhang, Bin, et al.
Publicado: (2025)
Triage: Hierarchical Visual Budgeting for Efficient Video Reasoning in Vision-Language Models
por: Wang, Anmin, et al.
Publicado: (2026)
por: Wang, Anmin, et al.
Publicado: (2026)
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
por: Yan, Haolong, et al.
Publicado: (2025)
por: Yan, Haolong, et al.
Publicado: (2025)
Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries
por: Lu, Haocheng, et al.
Publicado: (2026)
por: Lu, Haocheng, et al.
Publicado: (2026)
RAD: Training an End-to-End Driving Policy via Large-Scale 3DGS-based Reinforcement Learning
por: Gao, Hao, et al.
Publicado: (2025)
por: Gao, Hao, et al.
Publicado: (2025)
ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Scene Reconstruction
por: Ni, Chaojun, et al.
Publicado: (2025)
por: Ni, Chaojun, et al.
Publicado: (2025)
Value-Driven Mixed-Precision Quantization for Patch-Based Inference on Microcontrollers
por: Tao, Wei, et al.
Publicado: (2024)
por: Tao, Wei, et al.
Publicado: (2024)
Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles
por: Liu, Jiawei, et al.
Publicado: (2026)
por: Liu, Jiawei, et al.
Publicado: (2026)
Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization
por: Wang, Jianzong, et al.
Publicado: (2026)
por: Wang, Jianzong, et al.
Publicado: (2026)
InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs
por: Li, Bin, et al.
Publicado: (2025)
por: Li, Bin, et al.
Publicado: (2025)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
por: Liu, Xiaoyang, et al.
Publicado: (2024)
por: Liu, Xiaoyang, et al.
Publicado: (2024)
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning
por: Chen, Boyu, et al.
Publicado: (2025)
por: Chen, Boyu, et al.
Publicado: (2025)
RoomPlanner: Explicit Layout Planner for Easier LLM-Driven 3D Room Generation
por: Sun, Wenzhuo, et al.
Publicado: (2025)
por: Sun, Wenzhuo, et al.
Publicado: (2025)
Learning Generalizable Human Motion Generator with Reinforcement Learning
por: Mao, Yunyao, et al.
Publicado: (2024)
por: Mao, Yunyao, et al.
Publicado: (2024)
Lighting-grounded Video Generation with Renderer-based Agent Reasoning
por: Cai, Ziqi, et al.
Publicado: (2026)
por: Cai, Ziqi, et al.
Publicado: (2026)
Enhancing Diffusion-based Restoration Models via Difficulty-Adaptive Reinforcement Learning with IQA Reward
por: Xu, Xiaogang, et al.
Publicado: (2025)
por: Xu, Xiaogang, et al.
Publicado: (2025)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
por: Wu, Jianzong, et al.
Publicado: (2024)
por: Wu, Jianzong, et al.
Publicado: (2024)
Agent-based Video Trimming
por: Yang, Lingfeng, et al.
Publicado: (2024)
por: Yang, Lingfeng, et al.
Publicado: (2024)
ADVEDM:Fine-grained Adversarial Attack against VLM-based Embodied Agents
por: Wang, Yichen, et al.
Publicado: (2025)
por: Wang, Yichen, et al.
Publicado: (2025)
Exploring Graph-based Knowledge: Multi-Level Feature Distillation via Channels Relational Graph
por: Wang, Zhiwei, et al.
Publicado: (2024)
por: Wang, Zhiwei, et al.
Publicado: (2024)
VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
por: Liu, Yuqi, et al.
Publicado: (2025)
por: Liu, Yuqi, et al.
Publicado: (2025)
GPF-Net: Gated Progressive Fusion Learning for Polyp Re-Identification
por: Xiang, Suncheng, et al.
Publicado: (2025)
por: Xiang, Suncheng, et al.
Publicado: (2025)
Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback
por: Lu, Jianglin, et al.
Publicado: (2025)
por: Lu, Jianglin, et al.
Publicado: (2025)
CLIPDrag: Combining Text-based and Drag-based Instructions for Image Editing
por: Jiang, Ziqi, et al.
Publicado: (2024)
por: Jiang, Ziqi, et al.
Publicado: (2024)
Learning Clustering-based Prototypes for Compositional Zero-shot Learning
por: Qu, Hongyu, et al.
Publicado: (2025)
por: Qu, Hongyu, et al.
Publicado: (2025)
Fitting Skeletal Models via Graph-based Learning
por: Gaggion, Nicolás, et al.
Publicado: (2024)
por: Gaggion, Nicolás, et al.
Publicado: (2024)
Ejemplares similares
-
Hierarchical-Task-Aware Multi-modal Mixture of Incremental LoRA Experts for Embodied Continual Learning
por: Jia, Ziqi, et al.
Publicado: (2025) -
CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control
por: Shi, Jiaqi, et al.
Publicado: (2026) -
DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement
por: Lu, Renjie, et al.
Publicado: (2026) -
Federated Domain Generalization with Domain-specific Soft Prompts Generation
por: Wu, Jianhan, et al.
Publicado: (2025) -
RATE-Nav: Region-Aware Termination Enhancement for Zero-shot Object Navigation with Vision-Language Models
por: Li, Junjie, et al.
Publicado: (2025)