Optimizing Language Model's Reasoning Abilities with Weak Supervision
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Tong, Yongqi, Wang, Sizhe, Li, Dawei, Wang, Yifan, Han, Simeng, Lin, Zi, Huang, Chengsong, Huang, Jiaxin, Shang, Jingbo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
von: Tong, Yongqi, et al.
Veröffentlicht: (2024)
von: Tong, Yongqi, et al.
Veröffentlicht: (2024)
BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment
von: Wang, Sizhe, et al.
Veröffentlicht: (2024)
von: Wang, Sizhe, et al.
Veröffentlicht: (2024)
RelayLLM: Efficient Reasoning via Collaborative Decoding
von: Huang, Chengsong, et al.
Veröffentlicht: (2026)
von: Huang, Chengsong, et al.
Veröffentlicht: (2026)
Divide, Reweight, and Conquer: A Logit Arithmetic Approach for In-Context Learning
von: Huang, Chengsong, et al.
Veröffentlicht: (2024)
von: Huang, Chengsong, et al.
Veröffentlicht: (2024)
VisPlay: Self-Evolving Vision-Language Models from Images
von: He, Yicheng, et al.
Veröffentlicht: (2025)
von: He, Yicheng, et al.
Veröffentlicht: (2025)
Taming Overconfidence in LLMs: Reward Calibration in RLHF
von: Leng, Jixuan, et al.
Veröffentlicht: (2024)
von: Leng, Jixuan, et al.
Veröffentlicht: (2024)
Text Grafting: Near-Distribution Weak Supervision for Minority Classes in Text Classification
von: Peng, Letian, et al.
Veröffentlicht: (2024)
von: Peng, Letian, et al.
Veröffentlicht: (2024)
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
von: Huang, Langlin, et al.
Veröffentlicht: (2026)
von: Huang, Langlin, et al.
Veröffentlicht: (2026)
Adapting Pretrained Language Models for Citation Classification via Self-Supervised Contrastive Learning
von: Li, Tong, et al.
Veröffentlicht: (2025)
von: Li, Tong, et al.
Veröffentlicht: (2025)
Learning to Reason via Mixture-of-Thought for Logical Reasoning
von: Zheng, Tong, et al.
Veröffentlicht: (2025)
von: Zheng, Tong, et al.
Veröffentlicht: (2025)
CrossWordBench: Evaluating the Reasoning Capabilities of LLMs and LVLMs with Controllable Puzzle Generation
von: Leng, Jixuan, et al.
Veröffentlicht: (2025)
von: Leng, Jixuan, et al.
Veröffentlicht: (2025)
Watermarks for Language Models via Probabilistic Automata
von: Wang, Yangkun, et al.
Veröffentlicht: (2025)
von: Wang, Yangkun, et al.
Veröffentlicht: (2025)
Open-world Multi-label Text Classification with Extremely Weak Supervision
von: Li, Xintong, et al.
Veröffentlicht: (2024)
von: Li, Xintong, et al.
Veröffentlicht: (2024)
GOFA: A Generative One-For-All Model for Joint Graph Language Modeling
von: Kong, Lecheng, et al.
Veröffentlicht: (2024)
von: Kong, Lecheng, et al.
Veröffentlicht: (2024)
Large Language Models Are Cross-Lingual Knowledge-Free Reasoners
von: Hu, Peng, et al.
Veröffentlicht: (2024)
von: Hu, Peng, et al.
Veröffentlicht: (2024)
READ: Improving Relation Extraction from an ADversarial Perspective
von: Li, Dawei, et al.
Veröffentlicht: (2024)
von: Li, Dawei, et al.
Veröffentlicht: (2024)
POSS: Position Specialist Generates Better Draft for Speculative Decoding
von: Huang, Langlin, et al.
Veröffentlicht: (2025)
von: Huang, Langlin, et al.
Veröffentlicht: (2025)
R-Zero: Self-Evolving Reasoning LLM from Zero Data
von: Huang, Chengsong, et al.
Veröffentlicht: (2025)
von: Huang, Chengsong, et al.
Veröffentlicht: (2025)
Eliciting Causal Abilities in Large Language Models for Reasoning Tasks
von: Wang, Yajing, et al.
Veröffentlicht: (2024)
von: Wang, Yajing, et al.
Veröffentlicht: (2024)
Training Data Efficiency in Multimodal Process Reward Models
von: Li, Jinyuan, et al.
Veröffentlicht: (2026)
von: Li, Jinyuan, et al.
Veröffentlicht: (2026)
HYBRIDMIND: Meta Selection of Natural Language and Symbolic Language for Enhanced LLM Reasoning
von: Han, Simeng, et al.
Veröffentlicht: (2024)
von: Han, Simeng, et al.
Veröffentlicht: (2024)
Efficient Test-Time Scaling via Self-Calibration
von: Huang, Chengsong, et al.
Veröffentlicht: (2025)
von: Huang, Chengsong, et al.
Veröffentlicht: (2025)
Chain-of-Thought Matters: Improving Long-Context Language Models with Reasoning Path Supervision
von: Zhu, Dawei, et al.
Veröffentlicht: (2025)
von: Zhu, Dawei, et al.
Veröffentlicht: (2025)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
von: Zhu, Qin, et al.
Veröffentlicht: (2025)
von: Zhu, Qin, et al.
Veröffentlicht: (2025)
Structured Reasoning for Large Language Models
von: Han, Jinyi, et al.
Veröffentlicht: (2026)
von: Han, Jinyi, et al.
Veröffentlicht: (2026)
Disentangling Memory and Reasoning Ability in Large Language Models
von: Jin, Mingyu, et al.
Veröffentlicht: (2024)
von: Jin, Mingyu, et al.
Veröffentlicht: (2024)
You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
von: Wei, Zhepei, et al.
Veröffentlicht: (2026)
von: Wei, Zhepei, et al.
Veröffentlicht: (2026)
Smaller Language Models are capable of selecting Instruction-Tuning Training Data for Larger Language Models
von: Mekala, Dheeraj, et al.
Veröffentlicht: (2024)
von: Mekala, Dheeraj, et al.
Veröffentlicht: (2024)
Correlation and Navigation in the Vocabulary Key Representation Space of Language Models
von: Peng, Letian, et al.
Veröffentlicht: (2024)
von: Peng, Letian, et al.
Veröffentlicht: (2024)
Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step-by-step
von: Zhong, Li, et al.
Veröffentlicht: (2024)
von: Zhong, Li, et al.
Veröffentlicht: (2024)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
von: Wang, Weiyun, et al.
Veröffentlicht: (2024)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
Quantifying and Optimizing Global Faithfulness in Persona-driven Role-playing
von: Peng, Letian, et al.
Veröffentlicht: (2024)
von: Peng, Letian, et al.
Veröffentlicht: (2024)
Actial: Activate Spatial Reasoning Ability of Multimodal Large Language Models
von: Zhan, Xiaoyu, et al.
Veröffentlicht: (2025)
von: Zhan, Xiaoyu, et al.
Veröffentlicht: (2025)
Distilling Instruction-following Abilities of Large Language Models with Task-aware Curriculum Planning
von: Yue, Yuanhao, et al.
Veröffentlicht: (2024)
von: Yue, Yuanhao, et al.
Veröffentlicht: (2024)
SLAM: Towards Efficient Multilingual Reasoning via Selective Language Alignment
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
Towards Reasoning Ability of Small Language Models
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
von: Srivastava, Gaurav, et al.
Veröffentlicht: (2025)
Improving Retrieval Augmented Language Model with Self-Reasoning
von: Xia, Yuan, et al.
Veröffentlicht: (2024)
von: Xia, Yuan, et al.
Veröffentlicht: (2024)
Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
von: Fan, Yuchun, et al.
Veröffentlicht: (2025)
LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
von: Gui, Jiayi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Can LLMs Learn from Previous Mistakes? Investigating LLMs' Errors to Boost for Reasoning
von: Tong, Yongqi, et al.
Veröffentlicht: (2024) -
BPO: Towards Balanced Preference Optimization between Knowledge Breadth and Depth in Alignment
von: Wang, Sizhe, et al.
Veröffentlicht: (2024) -
RelayLLM: Efficient Reasoning via Collaborative Decoding
von: Huang, Chengsong, et al.
Veröffentlicht: (2026) -
Divide, Reweight, and Conquer: A Logit Arithmetic Approach for In-Context Learning
von: Huang, Chengsong, et al.
Veröffentlicht: (2024) -
VisPlay: Self-Evolving Vision-Language Models from Images
von: He, Yicheng, et al.
Veröffentlicht: (2025)