Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Kun, Shi, Peng, Qiu, Haibo, Zeng, Zhixiong, Yang, Siqi, Mao, Wenji, Ma, Lin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
par: Chen, Kun, et autres
Publié: (2026)
par: Chen, Kun, et autres
Publié: (2026)
Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
par: Lan, Xiaohan, et autres
Publié: (2025)
par: Lan, Xiaohan, et autres
Publié: (2025)
Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
par: Qiu, Haibo, et autres
Publié: (2025)
par: Qiu, Haibo, et autres
Publié: (2025)
Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning
par: Yang, Siqi, et autres
Publié: (2025)
par: Yang, Siqi, et autres
Publié: (2025)
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
par: Zhong, Yufeng, et autres
Publié: (2025)
par: Zhong, Yufeng, et autres
Publié: (2025)
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
par: Liu, Fanfan, et autres
Publié: (2026)
par: Liu, Fanfan, et autres
Publié: (2026)
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
STAGE: Stable and Generalizable GRPO for Autoregressive Image Generation
par: Ma, Xiaoxiao, et autres
Publié: (2025)
par: Ma, Xiaoxiao, et autres
Publié: (2025)
Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start
par: Wei, Lai, et autres
Publié: (2025)
par: Wei, Lai, et autres
Publié: (2025)
VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning
par: Zhao, Xuanle, et autres
Publié: (2025)
par: Zhao, Xuanle, et autres
Publié: (2025)
SPECS: Specificity-Enhanced CLIP-Score for Long Image Caption Evaluation
par: Chen, Xiaofu, et autres
Publié: (2025)
par: Chen, Xiaofu, et autres
Publié: (2025)
Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization
par: Qiu, Xinyu, et autres
Publié: (2026)
par: Qiu, Xinyu, et autres
Publié: (2026)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
par: Chen, Shuang, et autres
Publié: (2025)
par: Chen, Shuang, et autres
Publié: (2025)
From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning
par: Luo, Ruilin, et autres
Publié: (2026)
par: Luo, Ruilin, et autres
Publié: (2026)
From Utterance to Vividity: Training Expressive Subtitle Translation LLM via Adaptive Local Preference Optimization
par: Cui, Chaoqun, et autres
Publié: (2026)
par: Cui, Chaoqun, et autres
Publié: (2026)
$\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts
par: Cemri, Mert, et autres
Publié: (2025)
par: Cemri, Mert, et autres
Publié: (2025)
Towards Better & Faster Autoregressive Image Generation: From the Perspective of Entropy
par: Ma, Xiaoxiao, et autres
Publié: (2025)
par: Ma, Xiaoxiao, et autres
Publié: (2025)
APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation
par: Chen, Kun, et autres
Publié: (2026)
par: Chen, Kun, et autres
Publié: (2026)
DecoupledESC: Enhancing Emotional Support Generation via Strategy-Response Decoupled Preference Optimization
par: Zhang, Chao, et autres
Publié: (2025)
par: Zhang, Chao, et autres
Publié: (2025)
TreeCUA: Efficiently Scaling GUI Automation with Tree-Structured Verifiable Evolution
par: Jiang, Deyang, et autres
Publié: (2026)
par: Jiang, Deyang, et autres
Publié: (2026)
Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation
par: Chen, Lei, et autres
Publié: (2025)
par: Chen, Lei, et autres
Publié: (2025)
Quality Over Clicks: Intrinsic Quality-Driven Iterative Reinforcement Learning for Cold-Start E-Commerce Query Suggestion
par: Sun, Qi, et autres
Publié: (2026)
par: Sun, Qi, et autres
Publié: (2026)
Hermes the Polyglot: A Unified Framework to Enhance Expressiveness for Multimodal Interlingual Subtitling
par: Cui, Chaoqun, et autres
Publié: (2026)
par: Cui, Chaoqun, et autres
Publié: (2026)
Decoupling Common and Unique Representations for Multimodal Self-supervised Learning
par: Wang, Yi, et autres
Publié: (2023)
par: Wang, Yi, et autres
Publié: (2023)
UITron-Speech: Towards Automated GUI Agents Based on Speech Instructions
par: Han, Wenkang, et autres
Publié: (2025)
par: Han, Wenkang, et autres
Publié: (2025)
OmniActor: A Generalist GUI and Embodied Agent for 2D&3D Worlds
par: Yang, Longrong, et autres
Publié: (2025)
par: Yang, Longrong, et autres
Publié: (2025)
MobileDreamer: Generative Sketch World Model for GUI Agent
par: Cao, Yilin, et autres
Publié: (2026)
par: Cao, Yilin, et autres
Publié: (2026)
DecisionNCE: Embodied Multimodal Representations via Implicit Preference Learning
par: Li, Jianxiong, et autres
Publié: (2024)
par: Li, Jianxiong, et autres
Publié: (2024)
Cold-Start Personalization via Training-Free Priors from Structured World Models
par: Bose, Avinandan, et autres
Publié: (2026)
par: Bose, Avinandan, et autres
Publié: (2026)
Exploring Lightweight Large Language Models for Court View Generation
par: Hou, Zhitian, et autres
Publié: (2026)
par: Hou, Zhitian, et autres
Publié: (2026)
Diffusion-Inspired Cold Start with Sufficient Prior in Computerized Adaptive Testing
par: Ma, Haiping, et autres
Publié: (2024)
par: Ma, Haiping, et autres
Publié: (2024)
DocTron-Formula: Generalized Formula Recognition in Complex and Structured Scenarios
par: Zhong, Yufeng, et autres
Publié: (2025)
par: Zhong, Yufeng, et autres
Publié: (2025)
Cold Start Prediction and Provisioning Optimization in Serverless Computing Using Deep Learning
par: N. Saravana Kumar, et autres
Publié: (2025)
par: N. Saravana Kumar, et autres
Publié: (2025)
Robust Multimodal Learning via Representation Decoupling
par: Wei, Shicai, et autres
Publié: (2024)
par: Wei, Shicai, et autres
Publié: (2024)
Elastic Feature Consolidation for Cold Start Exemplar-Free Incremental Learning
par: Magistri, Simone, et autres
Publié: (2024)
par: Magistri, Simone, et autres
Publié: (2024)
From Zero to Hero: Cold-Start Anomaly Detection
par: Reiss, Tal, et autres
Publié: (2024)
par: Reiss, Tal, et autres
Publié: (2024)
MedCAL-Bench: A Comprehensive Benchmark on Cold-Start Active Learning with Foundation Models for Medical Image Analysis
par: Zhu, Ning, et autres
Publié: (2025)
par: Zhu, Ning, et autres
Publié: (2025)
Robust Preference Alignment via Directional Neighborhood Consensus
par: Mao, Ruochen, et autres
Publié: (2025)
par: Mao, Ruochen, et autres
Publié: (2025)
Representation Space Constrained Learning with Modality Decoupling for Multimodal Object Detection
par: Shao, YiKang, et autres
Publié: (2025)
par: Shao, YiKang, et autres
Publié: (2025)
Documents similaires
-
Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective
par: Chen, Kun, et autres
Publié: (2026) -
Metis-HOME: Hybrid Optimized Mixture-of-Experts for Multimodal Reasoning
par: Lan, Xiaohan, et autres
Publié: (2025) -
Metis-RISE: RL Incentivizes and SFT Enhances Multimodal Reasoning Model Learning
par: Qiu, Haibo, et autres
Publié: (2025) -
Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning
par: Yang, Siqi, et autres
Publié: (2025) -
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR
par: Zhong, Yufeng, et autres
Publié: (2025)