Enregistré dans:
| Auteurs principaux: | Fang, Yiyang, Huang, Wenke, Fu, Pei, Yang, Yihao, Su, Kehua, Luo, Zhenbo, Luan, Jian, Ye, Mang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.23802 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language Models
par: Liang, Jian, et autres
Publié: (2025)
par: Liang, Jian, et autres
Publié: (2025)
Learn from Downstream and Be Yourself in Multimodal Large Language Model Fine-Tuning
par: Huang, Wenke, et autres
Publié: (2024)
par: Huang, Wenke, et autres
Publié: (2024)
Fair Federated Learning under Domain Skew with Local Consistency and Domain Diversity
par: Chen, Yuhang, et autres
Publié: (2024)
par: Chen, Yuhang, et autres
Publié: (2024)
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
par: Yang, Qu, et autres
Publié: (2024)
par: Yang, Qu, et autres
Publié: (2024)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
par: Qi, Yukun, et autres
Publié: (2026)
par: Qi, Yukun, et autres
Publié: (2026)
Federated Graph Semantic and Structural Learning
par: Huang, Wenke, et autres
Publié: (2024)
par: Huang, Wenke, et autres
Publié: (2024)
FedSSP: Federated Graph Learning with Spectral Knowledge and Personalized Preference
par: Tan, Zihan, et autres
Publié: (2024)
par: Tan, Zihan, et autres
Publié: (2024)
EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Spoken Dialogue Systems
par: Liu, Jingwen, et autres
Publié: (2025)
par: Liu, Jingwen, et autres
Publié: (2025)
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding
par: Li, Jiaze, et autres
Publié: (2025)
par: Li, Jiaze, et autres
Publié: (2025)
Keeping Yourself is Important in Downstream Tuning Multimodal Large Language Model
par: Huang, Wenke, et autres
Publié: (2025)
par: Huang, Wenke, et autres
Publié: (2025)
A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations
par: Ye, Mang, et autres
Publié: (2025)
par: Ye, Mang, et autres
Publié: (2025)
Shuffle-R1: Efficient RL framework for Multimodal Large Language Models via Data-centric Dynamic Shuffle
par: Zhu, Linghao, et autres
Publié: (2025)
par: Zhu, Linghao, et autres
Publié: (2025)
Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning
par: Zhang, Shaojie, et autres
Publié: (2025)
par: Zhang, Shaojie, et autres
Publié: (2025)
EMO-KNOW: A Large Scale Dataset on Emotion and Emotion-cause
par: Nguyen, Mia Huong, et autres
Publié: (2024)
par: Nguyen, Mia Huong, et autres
Publié: (2024)
EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition
par: Li, Pengcheng, et autres
Publié: (2025)
par: Li, Pengcheng, et autres
Publié: (2025)
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization
par: Rong, Xuankun, et autres
Publié: (2025)
par: Rong, Xuankun, et autres
Publié: (2025)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
par: Zhou, Dingkun, et autres
Publié: (2025)
par: Zhou, Dingkun, et autres
Publié: (2025)
Thinking in cocktail party: Chain-of-Thought and reinforcement learning for target speaker automatic speech recognition
par: Zhang, Yiru, et autres
Publié: (2025)
par: Zhang, Yiru, et autres
Publié: (2025)
S2FGL: Spatial Spectral Federated Graph Learning
par: Tan, Zihan, et autres
Publié: (2025)
par: Tan, Zihan, et autres
Publié: (2025)
ThanoRA: Task Heterogeneity-Aware Multi-Task Low-Rank Adaptation
par: Liang, Jian, et autres
Publié: (2025)
par: Liang, Jian, et autres
Publié: (2025)
EMO-TTA: Improving Test-Time Adaptation of Audio-Language Models for Speech Emotion Recognition
par: Shi, Jiacheng, et autres
Publié: (2025)
par: Shi, Jiacheng, et autres
Publié: (2025)
EMO-SUPERB: An In-depth Look at Speech Emotion Recognition
par: Wu, Haibin, et autres
Publié: (2024)
par: Wu, Haibin, et autres
Publié: (2024)
BTL-UI: Blink-Think-Link Reasoning Model for GUI Agent
par: Zhang, Shaojie, et autres
Publié: (2025)
par: Zhang, Shaojie, et autres
Publié: (2025)
nEMO: Dataset of Emotional Speech in Polish
par: Christop, Iwona
Publié: (2024)
par: Christop, Iwona
Publié: (2024)
Think Silently, Think Fast: Dynamic Latent Compression of LLM Reasoning Chains
par: Tan, Wenhui, et autres
Publié: (2025)
par: Tan, Wenhui, et autres
Publié: (2025)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
par: Li, Jiaze, et autres
Publié: (2026)
par: Li, Jiaze, et autres
Publié: (2026)
EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning
par: Xing, Bohao, et autres
Publié: (2024)
par: Xing, Bohao, et autres
Publié: (2024)
ChronoForge-RL: Chronological Forging through Reinforcement Learning for Enhanced Video Understanding
par: Chen, Kehua
Publié: (2025)
par: Chen, Kehua
Publié: (2025)
An Empirical Study of Federated Prompt Learning for Vision Language Model
par: Wang, Zhihao, et autres
Publié: (2025)
par: Wang, Zhihao, et autres
Publié: (2025)
R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning
par: Jiang, Zhizheng, et autres
Publié: (2026)
par: Jiang, Zhizheng, et autres
Publié: (2026)
Revisiting Entropy in Reinforcement Learning for Large Reasoning Models
par: Jin, Renren, et autres
Publié: (2025)
par: Jin, Renren, et autres
Publié: (2025)
Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models
par: Tan, Wenhui, et autres
Publié: (2026)
par: Tan, Wenhui, et autres
Publié: (2026)
Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models
par: Xu, Longwei, et autres
Publié: (2026)
par: Xu, Longwei, et autres
Publié: (2026)
VOW: Verifiable and Oblivious Watermark Detection for Large Language Models
par: Luan, Xiaokun, et autres
Publié: (2026)
par: Luan, Xiaokun, et autres
Publié: (2026)
Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation
par: Li, Xuetao, et autres
Publié: (2026)
par: Li, Xuetao, et autres
Publié: (2026)
R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning
par: Zhang, Zirui, et autres
Publié: (2026)
par: Zhang, Zirui, et autres
Publié: (2026)
Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs
par: Zhang, Shaojie, et autres
Publié: (2025)
par: Zhang, Shaojie, et autres
Publié: (2025)
MECap-R1: Emotion-aware Policy with Reinforcement Learning for Multimodal Emotion Captioning
par: Sun, Haoqin, et autres
Publié: (2025)
par: Sun, Haoqin, et autres
Publié: (2025)
Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
par: Zheng, Yuanlei, et autres
Publié: (2026)
par: Zheng, Yuanlei, et autres
Publié: (2026)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
par: Wang, Ye, et autres
Publié: (2025)
par: Wang, Ye, et autres
Publié: (2025)
Documents similaires
-
LoRASculpt: Sculpting LoRA for Harmonizing General and Specialized Knowledge in Multimodal Large Language Models
par: Liang, Jian, et autres
Publié: (2025) -
Learn from Downstream and Be Yourself in Multimodal Large Language Model Fine-Tuning
par: Huang, Wenke, et autres
Publié: (2024) -
Fair Federated Learning under Domain Skew with Local Consistency and Domain Diversity
par: Chen, Yuhang, et autres
Publié: (2024) -
EmoLLM: Multimodal Emotional Understanding Meets Large Language Models
par: Yang, Qu, et autres
Publié: (2024) -
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
par: Qi, Yukun, et autres
Publié: (2026)