Guardado en:
| Autores principales: | Sun, Peng, Shen, Huawen, Ban, Yi, Fu, Tianfan, Wang, Yanbo, Li, Yuqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.09715 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reasoning BO: Enhancing Bayesian Optimization with Long-Context Reasoning Power of LLMs
por: Yang, Zhuo, et al.
Publicado: (2025)
por: Yang, Zhuo, et al.
Publicado: (2025)
KG4RecEval: Does Knowledge Graph Really Matter for Recommender Systems?
por: Zhang, Haonan, et al.
Publicado: (2024)
por: Zhang, Haonan, et al.
Publicado: (2024)
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
por: Liu, Yichao, et al.
Publicado: (2026)
por: Liu, Yichao, et al.
Publicado: (2026)
QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
por: Xie, Jiaqing, et al.
Publicado: (2025)
por: Xie, Jiaqing, et al.
Publicado: (2025)
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
por: Yang, Zhuo, et al.
Publicado: (2025)
por: Yang, Zhuo, et al.
Publicado: (2025)
SkillsInjector: Dynamic Skill Context Construction for LLM Agents
por: Li, Yanchao, et al.
Publicado: (2026)
por: Li, Yanchao, et al.
Publicado: (2026)
Object Attribute Matters in Visual Question Answering
por: Li, Peize, et al.
Publicado: (2023)
por: Li, Peize, et al.
Publicado: (2023)
Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?
por: Wang, Yanbo, et al.
Publicado: (2025)
por: Wang, Yanbo, et al.
Publicado: (2025)
Structure-based Drug Design Benchmark: Do 3D Methods Really Dominate?
por: Zheng, Kangyu, et al.
Publicado: (2024)
por: Zheng, Kangyu, et al.
Publicado: (2024)
Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment
por: Li, Jiaxiang, et al.
Publicado: (2024)
por: Li, Jiaxiang, et al.
Publicado: (2024)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
por: Xi, Gongli, et al.
Publicado: (2026)
por: Xi, Gongli, et al.
Publicado: (2026)
Rethinking Generalization in Reasoning SFT: A Conditional Analysis on Optimization, Data, and Model Capability
por: Ren, Qihan, et al.
Publicado: (2026)
por: Ren, Qihan, et al.
Publicado: (2026)
Does More Inference-Time Compute Really Help Robustness?
por: Wu, Tong, et al.
Publicado: (2025)
por: Wu, Tong, et al.
Publicado: (2025)
QCS-ADME: Quantum Circuit Search for Drug Property Prediction with Imbalanced Data and Regression Adaptation
por: Zheng, Kangyu, et al.
Publicado: (2025)
por: Zheng, Kangyu, et al.
Publicado: (2025)
Object-Centric Vision Token Pruning for Vision Language Models
por: Li, Guangyuan, et al.
Publicado: (2025)
por: Li, Guangyuan, et al.
Publicado: (2025)
SFT-GRPO Data Overlap as a Post-Training Hyperparameter for Autoformalization
por: Su, Xiaole, et al.
Publicado: (2026)
por: Su, Xiaole, et al.
Publicado: (2026)
ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection
por: Liu, Tao, et al.
Publicado: (2026)
por: Liu, Tao, et al.
Publicado: (2026)
Quagmires in SFT-RL Post-Training: When High SFT Scores Mislead and What to Use Instead
por: Kang, Feiyang, et al.
Publicado: (2025)
por: Kang, Feiyang, et al.
Publicado: (2025)
DeepProtein: Deep Learning Library and Benchmark for Protein Sequence Learning
por: Xie, Jiaqing, et al.
Publicado: (2024)
por: Xie, Jiaqing, et al.
Publicado: (2024)
Consolidation or Adaptation? PRISM: Disentangling SFT and RL Data via Gradient Concentration
por: Zhao, Yang, et al.
Publicado: (2026)
por: Zhao, Yang, et al.
Publicado: (2026)
Does Chain-of-Thought Reasoning Really Reduce Harmfulness from Jailbreaking?
por: Lu, Chengda, et al.
Publicado: (2025)
por: Lu, Chengda, et al.
Publicado: (2025)
Does Theory of Mind Improvement Really Benefit Human-AI Interactions? Empirical Findings from Interactive Evaluations
por: Gong, Nanxu, et al.
Publicado: (2026)
por: Gong, Nanxu, et al.
Publicado: (2026)
OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields
por: Liu, Wanhao, et al.
Publicado: (2026)
por: Liu, Wanhao, et al.
Publicado: (2026)
From SFT to RL: Demystifying the Post-Training Pipeline for LLM-based Vulnerability Detection
por: Li, Youpeng, et al.
Publicado: (2026)
por: Li, Youpeng, et al.
Publicado: (2026)
Training-Free Unsupervised Prompt for Vision-Language Models
por: Long, Sifan, et al.
Publicado: (2024)
por: Long, Sifan, et al.
Publicado: (2024)
GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training
por: Hu, Yuelin, et al.
Publicado: (2026)
por: Hu, Yuelin, et al.
Publicado: (2026)
RadDiff: Retrieval-Augmented Denoising Diffusion for Protein Inverse Folding
por: Han, Jin, et al.
Publicado: (2025)
por: Han, Jin, et al.
Publicado: (2025)
Efficiency for Free: Ideal Data Are Transportable Representations
por: Sun, Peng, et al.
Publicado: (2024)
por: Sun, Peng, et al.
Publicado: (2024)
Does Feasibility Matter? Understanding the Impact of Feasibility on Synthetic Training Data
por: Liu, Yiwen, et al.
Publicado: (2025)
por: Liu, Yiwen, et al.
Publicado: (2025)
Debunk the Myth of SFT Generalization
por: Lin, Xiaofeng, et al.
Publicado: (2025)
por: Lin, Xiaofeng, et al.
Publicado: (2025)
Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?
por: Wei, Qianshan, et al.
Publicado: (2026)
por: Wei, Qianshan, et al.
Publicado: (2026)
NMRTrans: Structure Elucidation from Experimental NMR Spectra via Set Transformers
por: Yang, Liujia, et al.
Publicado: (2026)
por: Yang, Liujia, et al.
Publicado: (2026)
Are Synthetic Time-series Data Really not as Good as Real Data?
por: Fu, Fanzhe, et al.
Publicado: (2024)
por: Fu, Fanzhe, et al.
Publicado: (2024)
Does the Skeleton-Recall Loss Really Work?
por: Arora, Devansh, et al.
Publicado: (2025)
por: Arora, Devansh, et al.
Publicado: (2025)
From Supervision to Exploration: What Does Protein Language Model Learn During Reinforcement Learning?
por: Cao, Hanqun, et al.
Publicado: (2025)
por: Cao, Hanqun, et al.
Publicado: (2025)
MMAPG: A Training-Free Framework for Multimodal Multi-hop Question Answering via Adaptive Planning Graphs
por: Hu, Yiheng, et al.
Publicado: (2025)
por: Hu, Yiheng, et al.
Publicado: (2025)
Order Doesn't Matter, But Reasoning Does: Training LLMs with Order-Centric Augmentation
por: He, Qianxi, et al.
Publicado: (2025)
por: He, Qianxi, et al.
Publicado: (2025)
mSFT: Addressing Dataset Mixtures Overfitting Heterogeneously in Multi-task SFT
por: Koh, Woosung, et al.
Publicado: (2026)
por: Koh, Woosung, et al.
Publicado: (2026)
MIMOSA: Multi-constraint Molecule Sampling for Molecule Optimization
por: Fu, Tianfan, et al.
Publicado: (2020)
por: Fu, Tianfan, et al.
Publicado: (2020)
TabDLM: Free-Form Tabular Data Generation via Joint Numerical-Language Diffusion
por: Cai, Donghong, et al.
Publicado: (2026)
por: Cai, Donghong, et al.
Publicado: (2026)
Ejemplares similares
-
Reasoning BO: Enhancing Bayesian Optimization with Long-Context Reasoning Power of LLMs
por: Yang, Zhuo, et al.
Publicado: (2025) -
KG4RecEval: Does Knowledge Graph Really Matter for Recommender Systems?
por: Zhang, Haonan, et al.
Publicado: (2024) -
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding
por: Liu, Yichao, et al.
Publicado: (2026) -
QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
por: Xie, Jiaqing, et al.
Publicado: (2025) -
MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization
por: Yang, Zhuo, et al.
Publicado: (2025)