Can LLMs Learn to Reason Robustly under Noisy Supervision?
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Shenzhi, Zhu, Guangcheng, Song, Bowen, Li, Sharon, Wang, Haobo, Zheng, Xing, Ma, Yingfan, Chen, Zhongqi, Wang, Weiqiang, Chen, Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning
di: Yang, Shenzhi, et al.
Pubblicazione: (2025)
di: Yang, Shenzhi, et al.
Pubblicazione: (2025)
Towards Robust Incremental Learning under Ambiguous Supervision
di: Wang, Rui, et al.
Pubblicazione: (2025)
di: Wang, Rui, et al.
Pubblicazione: (2025)
Harnessing Feature Resonance under Arbitrary Target Alignment for Out-of-Distribution Node Detection
di: Yang, Shenzhi, et al.
Pubblicazione: (2025)
di: Yang, Shenzhi, et al.
Pubblicazione: (2025)
Multimodal Adaptive Retrieval Augmented Generation through Internal Representation Learning
di: Du, Ruoshuang, et al.
Pubblicazione: (2026)
di: Du, Ruoshuang, et al.
Pubblicazione: (2026)
China’s Two Child Policy: Can a Name Change Mean a Game Change?
di: Chen Guangcheng
Pubblicazione: (2016)
di: Chen Guangcheng
Pubblicazione: (2016)
Patterns Over Principles: The Fragility of Inductive Reasoning in LLMs under Noisy Observations
di: Li, Chunyang, et al.
Pubblicazione: (2025)
di: Li, Chunyang, et al.
Pubblicazione: (2025)
KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering
di: Sun, Xin, et al.
Pubblicazione: (2025)
di: Sun, Xin, et al.
Pubblicazione: (2025)
FastBUS: A Fast Bayesian Framework for Unified Weakly-Supervised Learning
di: Wang, Ziquan, et al.
Pubblicazione: (2026)
di: Wang, Ziquan, et al.
Pubblicazione: (2026)
ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs
di: Zhang, Bonan, et al.
Pubblicazione: (2025)
di: Zhang, Bonan, et al.
Pubblicazione: (2025)
Rethinking Multiple Instance Learning: Developing an Instance-Level Classifier via Weakly-Supervised Self-Training
di: Ma, Yingfan, et al.
Pubblicazione: (2024)
di: Ma, Yingfan, et al.
Pubblicazione: (2024)
Impact of Noisy Supervision in Foundation Model Learning
di: Chen, Hao, et al.
Pubblicazione: (2024)
di: Chen, Hao, et al.
Pubblicazione: (2024)
GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering
di: Sun, Xin, et al.
Pubblicazione: (2026)
di: Sun, Xin, et al.
Pubblicazione: (2026)
Predict the Retrieval! Test time adaptation for Retrieval Augmented Generation
di: Sun, Xin, et al.
Pubblicazione: (2026)
di: Sun, Xin, et al.
Pubblicazione: (2026)
Personalized Causal Graph Reasoning for LLMs: An Implementation for Dietary Recommendations
di: Yang, Zhongqi, et al.
Pubblicazione: (2025)
di: Yang, Zhongqi, et al.
Pubblicazione: (2025)
CRoF: CLIP-based Robust Few-shot Learning on Noisy Labels
di: Deng, Shizhuo, et al.
Pubblicazione: (2024)
di: Deng, Shizhuo, et al.
Pubblicazione: (2024)
Can Language Models Perform Robust Reasoning in Chain-of-thought Prompting with Noisy Rationales?
di: Zhou, Zhanke, et al.
Pubblicazione: (2024)
di: Zhou, Zhanke, et al.
Pubblicazione: (2024)
ABench-Physics: Benchmarking Physical Reasoning in LLMs via High-Difficulty and Dynamic Physics Problems
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
When Can LLMs Learn to Reason with Weak Supervision?
di: Rahman, Salman, et al.
Pubblicazione: (2026)
di: Rahman, Salman, et al.
Pubblicazione: (2026)
Robustness of Online Identification-based Policy Iteration to Noisy Data
di: Song, Bowen, et al.
Pubblicazione: (2025)
di: Song, Bowen, et al.
Pubblicazione: (2025)
VRPO: Rethinking Value Modeling for Robust RL Training under Noisy Supervision
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
di: Zhu, Dingwei, et al.
Pubblicazione: (2025)
Divide-Then-Align: Honest Alignment based on the Knowledge Boundary of RAG
di: Sun, Xin, et al.
Pubblicazione: (2025)
di: Sun, Xin, et al.
Pubblicazione: (2025)
Understanding and Mitigating the Bias in Sample Selection for Learning with Noisy Labels
di: Wei, Qi, et al.
Pubblicazione: (2024)
di: Wei, Qi, et al.
Pubblicazione: (2024)
From Reasoning Chains to Verifiable Subproblems: Curriculum Reinforcement Learning Enables Credit Assignment for LLM Reasoning
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
di: Jiang, Xitai, et al.
Pubblicazione: (2026)
Uncertainty-Aware Robust Learning on Noisy Graphs
di: Chen, Shuyi, et al.
Pubblicazione: (2023)
di: Chen, Shuyi, et al.
Pubblicazione: (2023)
HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning
di: Wang, Shenzhi, et al.
Pubblicazione: (2026)
di: Wang, Shenzhi, et al.
Pubblicazione: (2026)
Supervised Contrastive Learning for Snapshot Spectral Imaging Face Anti-Spoofing
di: Song, Chuanbiao, et al.
Pubblicazione: (2024)
di: Song, Chuanbiao, et al.
Pubblicazione: (2024)
DISTINGUIENDO SIMILITUDES Y DIFERENCIAS; COMBINANDO ORIENTE Y OCCIDENTE. PERSPECTIVAS PRESENTES Y FUTURAS DE LA CULTURA CHINA
di: Li Shenzhi
Pubblicazione: (2012)
di: Li Shenzhi
Pubblicazione: (2012)
Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
di: Chen, Yuxin, et al.
Pubblicazione: (2026)
Trusted Multi-view Learning under Noisy Supervision
di: Zhang, Yilin, et al.
Pubblicazione: (2024)
di: Zhang, Yilin, et al.
Pubblicazione: (2024)
RANSAC Revisited: An Improved Algorithm for Robust Subspace Recovery under Adversarial and Noisy Corruptions
di: Chen, Guixian, et al.
Pubblicazione: (2025)
di: Chen, Guixian, et al.
Pubblicazione: (2025)
Robust Learning of Diffusion Models with Extremely Noisy Conditions
di: Chen, Xin, et al.
Pubblicazione: (2025)
di: Chen, Xin, et al.
Pubblicazione: (2025)
Data Contamination Calibration for Black-box LLMs
di: Ye, Wentao, et al.
Pubblicazione: (2024)
di: Ye, Wentao, et al.
Pubblicazione: (2024)
How Well Can Preference Optimization Generalize Under Noisy Feedback?
di: Im, Shawn, et al.
Pubblicazione: (2025)
di: Im, Shawn, et al.
Pubblicazione: (2025)
Adaptive Uncertainty-Aware Tree Search for Robust Reasoning
di: Song, Zeen, et al.
Pubblicazione: (2026)
di: Song, Zeen, et al.
Pubblicazione: (2026)
Rethinking Multiple Instance Learning for Whole Slide Image Classification: A Good Instance Classifier is All You Need
di: Qu, Linhao, et al.
Pubblicazione: (2023)
di: Qu, Linhao, et al.
Pubblicazione: (2023)
Investigating and Mitigating the Side Effects of Noisy Views for Self-Supervised Clustering Algorithms in Practical Multi-View Scenarios
di: Xu, Jie, et al.
Pubblicazione: (2023)
di: Xu, Jie, et al.
Pubblicazione: (2023)
NoisyGL: A Comprehensive Benchmark for Graph Neural Networks under Label Noise
di: Wang, Zhonghao, et al.
Pubblicazione: (2024)
di: Wang, Zhonghao, et al.
Pubblicazione: (2024)
RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences
di: Cheng, Jie, et al.
Pubblicazione: (2024)
di: Cheng, Jie, et al.
Pubblicazione: (2024)
RobustFT: Robust Supervised Fine-tuning for Large Language Models under Noisy Response
di: Luo, Junyu, et al.
Pubblicazione: (2024)
di: Luo, Junyu, et al.
Pubblicazione: (2024)
Machine Unlearning for Robust DNNs: Attribution-Guided Partitioning and Neuron Pruning in Noisy Environments
di: Jin, Deliang, et al.
Pubblicazione: (2025)
di: Jin, Deliang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
TraPO: A Semi-Supervised Reinforcement Learning Framework for Boosting LLM Reasoning
di: Yang, Shenzhi, et al.
Pubblicazione: (2025) -
Towards Robust Incremental Learning under Ambiguous Supervision
di: Wang, Rui, et al.
Pubblicazione: (2025) -
Harnessing Feature Resonance under Arbitrary Target Alignment for Out-of-Distribution Node Detection
di: Yang, Shenzhi, et al.
Pubblicazione: (2025) -
Multimodal Adaptive Retrieval Augmented Generation through Internal Representation Learning
di: Du, Ruoshuang, et al.
Pubblicazione: (2026) -
China’s Two Child Policy: Can a Name Change Mean a Game Change?
di: Chen Guangcheng
Pubblicazione: (2016)