Enregistré dans:
| Auteurs principaux: | Liang, Kaizhao, Chen, Lizhang, Liu, Bo, Liu, Qiang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2411.16085 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Memory-Efficient LLM Training with Online Subspace Descent
par: Liang, Kaizhao, et autres
Publié: (2024)
par: Liang, Kaizhao, et autres
Publié: (2024)
Reward Generalization in RLHF: A Topological Perspective
par: Qiu, Tianyi, et autres
Publié: (2024)
par: Qiu, Tianyi, et autres
Publié: (2024)
Fair Clustering for Data Summarization: Improved Approximation Algorithms and Complexity Insights
par: Gadekar, Ameet, et autres
Publié: (2024)
par: Gadekar, Ameet, et autres
Publié: (2024)
COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection
par: Xiao, Jinqi, et autres
Publié: (2024)
par: Xiao, Jinqi, et autres
Publié: (2024)
Using Code Generation to Solve Open Instances of Combinatorial Design Problems
par: Rosin, Christopher D.
Publié: (2025)
par: Rosin, Christopher D.
Publié: (2025)
Explaining latent representations of generative models with large multimodal models
par: Zhu, Mengdan, et autres
Publié: (2024)
par: Zhu, Mengdan, et autres
Publié: (2024)
MobileCLIP2: Improving Multi-Modal Reinforced Training
par: Faghri, Fartash, et autres
Publié: (2025)
par: Faghri, Fartash, et autres
Publié: (2025)
Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models
par: Wu, Junfei, et autres
Publié: (2024)
par: Wu, Junfei, et autres
Publié: (2024)
HLL: Can Agents Cross Humanity's Last Line of Verification?
par: Song, Xinhao, et autres
Publié: (2026)
par: Song, Xinhao, et autres
Publié: (2026)
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
par: Wan, David, et autres
Publié: (2024)
par: Wan, David, et autres
Publié: (2024)
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023)
par: Liu, Haotian, et autres
Publié: (2023)
First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
par: Wei, Lai, et autres
Publié: (2025)
par: Wei, Lai, et autres
Publié: (2025)
Soft Tuy-Completeness for Robust Projection Selection in Cone-Beam CT
par: Schneider, Linda-Sophie, et autres
Publié: (2026)
par: Schneider, Linda-Sophie, et autres
Publié: (2026)
Post-processing of coronary and myocardial spatial data
par: Mackenzie, Jay Aodh, et autres
Publié: (2022)
par: Mackenzie, Jay Aodh, et autres
Publié: (2022)
Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks
par: Zhou, Andy, et autres
Publié: (2024)
par: Zhou, Andy, et autres
Publié: (2024)
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
par: Zhou, Gengze, et autres
Publié: (2025)
par: Zhou, Gengze, et autres
Publié: (2025)
Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts
par: Chen, Lizhang, et autres
Publié: (2023)
par: Chen, Lizhang, et autres
Publié: (2023)
Diving into Self-Evolving Training for Multimodal Reasoning
par: Liu, Wei, et autres
Publié: (2024)
par: Liu, Wei, et autres
Publié: (2024)
Continual SFT Matches Multimodal RLHF with Negative Supervision
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
RewardHarness: Self-Evolving Agentic Post-Training
par: Zhang, Yuxuan, et autres
Publié: (2026)
par: Zhang, Yuxuan, et autres
Publié: (2026)
Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining
par: Liu, Chenxi, et autres
Publié: (2025)
par: Liu, Chenxi, et autres
Publié: (2025)
A Fair Post-Processing Method based on the MADD Metric for Predictive Student Models
par: Verger, Mélina, et autres
Publié: (2024)
par: Verger, Mélina, et autres
Publié: (2024)
Vision-Language Models Can Self-Improve Reasoning via Reflection
par: Cheng, Kanzhi, et autres
Publié: (2024)
par: Cheng, Kanzhi, et autres
Publié: (2024)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
par: Liu, Zechun, et autres
Publié: (2025)
par: Liu, Zechun, et autres
Publié: (2025)
Why Stop at Words? Unveiling the Bigger Picture through Line-Level OCR
par: Vempati, Shashank, et autres
Publié: (2025)
par: Vempati, Shashank, et autres
Publié: (2025)
OpenClaw-RL: Train Any Agent Simply by Talking
par: Wang, Yinjie, et autres
Publié: (2026)
par: Wang, Yinjie, et autres
Publié: (2026)
Automatic Operator-level Parallelism Planning for Distributed Deep Learning -- A Mixed-Integer Programming Approach
par: She, Ruifeng, et autres
Publié: (2025)
par: She, Ruifeng, et autres
Publié: (2025)
Applications of Tao General Difference in Discrete Domain
par: Tao, Linmi, et autres
Publié: (2024)
par: Tao, Linmi, et autres
Publié: (2024)
A Theory of General Difference in Continuous and Discrete Domain
par: Tao, Linmi, et autres
Publié: (2023)
par: Tao, Linmi, et autres
Publié: (2023)
RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models
par: Khaki, Saeed, et autres
Publié: (2024)
par: Khaki, Saeed, et autres
Publié: (2024)
On Training-Test (Mis)alignment in Unsupervised Combinatorial Optimization: Observation, Empirical Exploration, and Analysis
par: Bu, Fanchen, et autres
Publié: (2025)
par: Bu, Fanchen, et autres
Publié: (2025)
Quantifying In-Context Reasoning Effects and Memorization Effects in LLMs
par: Lou, Siyu, et autres
Publié: (2024)
par: Lou, Siyu, et autres
Publié: (2024)
OneLLM: One Framework to Align All Modalities with Language
par: Han, Jiaming, et autres
Publié: (2023)
par: Han, Jiaming, et autres
Publié: (2023)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion
par: Jiang, Ruixiang, et autres
Publié: (2024)
par: Jiang, Ruixiang, et autres
Publié: (2024)
Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning
par: Chen, Shuang, et autres
Publié: (2025)
par: Chen, Shuang, et autres
Publié: (2025)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
par: Zhang, Jingyi, et autres
Publié: (2025)
par: Zhang, Jingyi, et autres
Publié: (2025)
MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
par: Xia, Peng, et autres
Publié: (2025)
par: Xia, Peng, et autres
Publié: (2025)
ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness
par: Liang, Yijun, et autres
Publié: (2025)
par: Liang, Yijun, et autres
Publié: (2025)
Approximately Optimal Search on a Higher-dimensional Sliding Puzzle
par: Merleau, Nono SC, et autres
Publié: (2024)
par: Merleau, Nono SC, et autres
Publié: (2024)
Documents similaires
-
Memory-Efficient LLM Training with Online Subspace Descent
par: Liang, Kaizhao, et autres
Publié: (2024) -
Reward Generalization in RLHF: A Topological Perspective
par: Qiu, Tianyi, et autres
Publié: (2024) -
Fair Clustering for Data Summarization: Improved Approximation Algorithms and Complexity Insights
par: Gadekar, Ameet, et autres
Publié: (2024) -
COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection
par: Xiao, Jinqi, et autres
Publié: (2024) -
Using Code Generation to Solve Open Instances of Combinatorial Design Problems
par: Rosin, Christopher D.
Publié: (2025)