Self-Taught Self-Correction for Small Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Moskvoretskii, Viktor, Biemann, Chris, Nikishina, Irina |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Low-Resource Machine Translation through the Lens of Personalized Federated Learning
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2024)
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2024)
Do I look like a `cat.n.01` to you? A Taxonomy Image Generation Benchmark
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025)
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025)
Adaptive Retrieval Without Self-Knowledge? Bringing Uncertainty Back Home
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025)
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025)
Self-Calibrating Language Models via Test-Time Discriminative Distillation
di: Hedna, Mohamed Rissal, et al.
Pubblicazione: (2026)
di: Hedna, Mohamed Rissal, et al.
Pubblicazione: (2026)
TaxoLLaMA: WordNet-based Model for Solving Multiple Lexical Semantic Tasks
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2024)
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2024)
Multilingual Self-Taught Faithfulness Evaluators
di: Alfano, Carlo, et al.
Pubblicazione: (2025)
di: Alfano, Carlo, et al.
Pubblicazione: (2025)
Argument-Based Comparative Question Answering Evaluation Benchmark
di: Nikishina, Irina, et al.
Pubblicazione: (2025)
di: Nikishina, Irina, et al.
Pubblicazione: (2025)
Large Language Models Are Overparameterized Text Encoders
di: K, Thennal D, et al.
Pubblicazione: (2024)
di: K, Thennal D, et al.
Pubblicazione: (2024)
Self-Taught Optimizer (STOP): Recursively Self-Improving Code Generation
di: Zelikman, Eric, et al.
Pubblicazione: (2023)
di: Zelikman, Eric, et al.
Pubblicazione: (2023)
V-STaR: Training Verifiers for Self-Taught Reasoners
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
di: Hosseini, Arian, et al.
Pubblicazione: (2024)
Self-AMPLIFY: Improving Small Language Models with Self Post Hoc Explanations
di: Bhan, Milan, et al.
Pubblicazione: (2024)
di: Bhan, Milan, et al.
Pubblicazione: (2024)
UnStar: Unlearning with Self-Taught Anti-Sample Reasoning for LLMs
di: Sinha, Yash, et al.
Pubblicazione: (2024)
di: Sinha, Yash, et al.
Pubblicazione: (2024)
On the Convergence of Moral Self-Correction in Large Language Models
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
di: Liu, Guangliang, et al.
Pubblicazione: (2025)
AdaSTaR: Adaptive Data Sampling for Training Self-Taught Reasoners
di: Koh, Woosung, et al.
Pubblicazione: (2025)
di: Koh, Woosung, et al.
Pubblicazione: (2025)
B-STaR: Monitoring and Balancing Exploration and Exploitation in Self-Taught Reasoners
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
di: Zeng, Weihao, et al.
Pubblicazione: (2024)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
di: Tsui, Ken
Pubblicazione: (2025)
di: Tsui, Ken
Pubblicazione: (2025)
Self-Taught Recognizer: Toward Unsupervised Adaptation for Speech Foundation Models
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
di: Hu, Yuchen, et al.
Pubblicazione: (2024)
Large Language Models Must Be Taught to Know What They Don't Know
di: Kapoor, Sanyam, et al.
Pubblicazione: (2024)
di: Kapoor, Sanyam, et al.
Pubblicazione: (2024)
HS-STaR: Hierarchical Sampling for Self-Taught Reasoners via Difficulty Estimation and Budget Reallocation
di: Xiong, Feng, et al.
Pubblicazione: (2025)
di: Xiong, Feng, et al.
Pubblicazione: (2025)
Sherlock: Self-Correcting Reasoning in Vision-Language Models
di: Ding, Yi, et al.
Pubblicazione: (2025)
di: Ding, Yi, et al.
Pubblicazione: (2025)
ProgCo: Program Helps Self-Correction of Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2025)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
Table-r1: Self-supervised and Reinforcement Learning for Program-based Table Reasoning in Small Language Models
di: Jin, Rihui, et al.
Pubblicazione: (2025)
di: Jin, Rihui, et al.
Pubblicazione: (2025)
Self-Evolved Preference Optimization for Enhancing Mathematical Reasoning in Small Language Models
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
di: Singh, Joykirat, et al.
Pubblicazione: (2025)
Learning Self-Correction in Vision-Language Models via Rollout Augmentation
di: Ding, Yi, et al.
Pubblicazione: (2026)
di: Ding, Yi, et al.
Pubblicazione: (2026)
ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning
di: Jiang, Juyong, et al.
Pubblicazione: (2026)
di: Jiang, Juyong, et al.
Pubblicazione: (2026)
LLM-Independent Adaptive RAG: Let the Question Speak for Itself
di: Marina, Maria, et al.
Pubblicazione: (2025)
di: Marina, Maria, et al.
Pubblicazione: (2025)
Self-MoE: Towards Compositional Large Language Models with Self-Specialized Experts
di: Kang, Junmo, et al.
Pubblicazione: (2024)
di: Kang, Junmo, et al.
Pubblicazione: (2024)
IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
di: Kasnavieh, Hossein Hosseini, et al.
Pubblicazione: (2026)
Large Language Models Can Self-Improve At Web Agent Tasks
di: Patel, Ajay, et al.
Pubblicazione: (2024)
di: Patel, Ajay, et al.
Pubblicazione: (2024)
Self-Training Large Language Models with Confident Reasoning
di: Jang, Hyosoon, et al.
Pubblicazione: (2025)
di: Jang, Hyosoon, et al.
Pubblicazione: (2025)
Compute Where it Counts: Self Optimizing Language Models
di: Akhauri, Yash, et al.
Pubblicazione: (2026)
di: Akhauri, Yash, et al.
Pubblicazione: (2026)
CREAM: Consistency Regularized Self-Rewarding Language Models
di: Wang, Zhaoyang, et al.
Pubblicazione: (2024)
di: Wang, Zhaoyang, et al.
Pubblicazione: (2024)
A Confidence-based Acquisition Model for Self-supervised Active Learning and Label Correction
di: van Niekerk, Carel, et al.
Pubblicazione: (2023)
di: van Niekerk, Carel, et al.
Pubblicazione: (2023)
GLLM: Self-Corrective G-Code Generation using Large Language Models with User Feedback
di: Abdelaal, Mohamed, et al.
Pubblicazione: (2025)
di: Abdelaal, Mohamed, et al.
Pubblicazione: (2025)
SelfIE: Self-Interpretation of Large Language Model Embeddings
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
di: Chen, Haozhe, et al.
Pubblicazione: (2024)
Self-Recognition in Language Models
di: Davidson, Tim R., et al.
Pubblicazione: (2024)
di: Davidson, Tim R., et al.
Pubblicazione: (2024)
CALM: Culturally Self-Aware Language Models
di: Shen, Lingzhi, et al.
Pubblicazione: (2026)
di: Shen, Lingzhi, et al.
Pubblicazione: (2026)
A Theoretical Understanding of Self-Correction through In-context Alignment
di: Wang, Yifei, et al.
Pubblicazione: (2024)
di: Wang, Yifei, et al.
Pubblicazione: (2024)
Self-Refining Language Model Anonymizers via Adversarial Distillation
di: Kim, Kyuyoung, et al.
Pubblicazione: (2025)
di: Kim, Kyuyoung, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Low-Resource Machine Translation through the Lens of Personalized Federated Learning
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2024) -
Do I look like a `cat.n.01` to you? A Taxonomy Image Generation Benchmark
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025) -
Adaptive Retrieval Without Self-Knowledge? Bringing Uncertainty Back Home
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2025) -
Self-Calibrating Language Models via Test-Time Discriminative Distillation
di: Hedna, Mohamed Rissal, et al.
Pubblicazione: (2026) -
TaxoLLaMA: WordNet-based Model for Solving Multiple Lexical Semantic Tasks
di: Moskvoretskii, Viktor, et al.
Pubblicazione: (2024)