Reinforcement Learning Improves Traversal of Hierarchical Knowledge in LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Renfei, Kaniselvan, Manasa, Mireshghallah, Niloofar |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Position: Privacy Is Not Just Memorization!
por: Mireshghallah, Niloofar, et al.
Publicado: (2025)
por: Mireshghallah, Niloofar, et al.
Publicado: (2025)
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
por: Liu, Xinyue, et al.
Publicado: (2026)
por: Liu, Xinyue, et al.
Publicado: (2026)
Differentially Private Learning Needs Better Model Initialization and Self-Distillation
por: Ngong, Ivoline C., et al.
Publicado: (2024)
por: Ngong, Ivoline C., et al.
Publicado: (2024)
Developing Story: Case Studies of Generative AI's Use in Journalism
por: Brigham, Natalie Grace, et al.
Publicado: (2024)
por: Brigham, Natalie Grace, et al.
Publicado: (2024)
Can LLMs Keep a Secret? Testing Privacy Implications of Language Models via Contextual Integrity Theory
por: Mireshghallah, Niloofar, et al.
Publicado: (2023)
por: Mireshghallah, Niloofar, et al.
Publicado: (2023)
Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning
por: Wang, Haozhe, et al.
Publicado: (2025)
por: Wang, Haozhe, et al.
Publicado: (2025)
SMDD-Bench: Can LLMs Solve Real-World Small Molecule Drug Design Tasks?
por: Han, Kevin, et al.
Publicado: (2026)
por: Han, Kevin, et al.
Publicado: (2026)
WebWalker: Benchmarking LLMs in Web Traversal
por: Wu, Jialong, et al.
Publicado: (2025)
por: Wu, Jialong, et al.
Publicado: (2025)
Spectrum Tuning: Post-Training for Distributional Coverage and In-Context Steerability
por: Sorensen, Taylor, et al.
Publicado: (2025)
por: Sorensen, Taylor, et al.
Publicado: (2025)
TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence
por: Hou, Guiyang, et al.
Publicado: (2025)
por: Hou, Guiyang, et al.
Publicado: (2025)
Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs
por: Wang, Ziliang, et al.
Publicado: (2025)
por: Wang, Ziliang, et al.
Publicado: (2025)
Bob's Confetti: Phonetic Memorization Attacks in Music and Video Generation
por: Roh, Jaechul, et al.
Publicado: (2025)
por: Roh, Jaechul, et al.
Publicado: (2025)
KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning
por: Wang, Shuai, et al.
Publicado: (2026)
por: Wang, Shuai, et al.
Publicado: (2026)
Scientific Knowledge-driven Decoding Constraints Improving the Reliability of LLMs
por: Ma, Maotian, et al.
Publicado: (2026)
por: Ma, Maotian, et al.
Publicado: (2026)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
por: Chen, Tong, et al.
Publicado: (2025)
por: Chen, Tong, et al.
Publicado: (2025)
UniHR: Hierarchical Representation Learning for Unified Knowledge Graph Link Prediction
por: Liu, Zhiqiang, et al.
Publicado: (2024)
por: Liu, Zhiqiang, et al.
Publicado: (2024)
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
por: Zhang, Guibin, et al.
Publicado: (2025)
por: Zhang, Guibin, et al.
Publicado: (2025)
Improving Factuality in LLMs via Inference-Time Knowledge Graph Construction
por: Wu, Shanglin, et al.
Publicado: (2025)
por: Wu, Shanglin, et al.
Publicado: (2025)
True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning
por: Tan, Weihao, et al.
Publicado: (2024)
por: Tan, Weihao, et al.
Publicado: (2024)
Reinforcement Learning from Reflective Feedback (RLRF): Aligning and Improving LLMs via Fine-Grained Self-Reflection
por: Lee, Kyungjae, et al.
Publicado: (2024)
por: Lee, Kyungjae, et al.
Publicado: (2024)
KARL: Mitigating Hallucinations in LLMs via Knowledge-Boundary-Aware Reinforcement Learning
por: Gao, Cheng, et al.
Publicado: (2026)
por: Gao, Cheng, et al.
Publicado: (2026)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
por: Chen, Mingyang, et al.
Publicado: (2025)
por: Chen, Mingyang, et al.
Publicado: (2025)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
por: Feng, Jiazhan, et al.
Publicado: (2025)
por: Feng, Jiazhan, et al.
Publicado: (2025)
GenKnowSub: Improving Modularity and Reusability of LLMs through General Knowledge Subtraction
por: Bagherifard, Mohammadtaha, et al.
Publicado: (2025)
por: Bagherifard, Mohammadtaha, et al.
Publicado: (2025)
R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning
por: Song, Huatong, et al.
Publicado: (2025)
por: Song, Huatong, et al.
Publicado: (2025)
KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning
por: Xu, Hongling, et al.
Publicado: (2025)
por: Xu, Hongling, et al.
Publicado: (2025)
Memorization and Knowledge Injection in Gated LLMs
por: Pan, Xu, et al.
Publicado: (2025)
por: Pan, Xu, et al.
Publicado: (2025)
Reinforcement Learning Enhanced LLMs: A Survey
por: Wang, Shuhe, et al.
Publicado: (2024)
por: Wang, Shuhe, et al.
Publicado: (2024)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
por: Zhang, Wenbo, et al.
Publicado: (2024)
por: Zhang, Wenbo, et al.
Publicado: (2024)
STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens
por: Liu, Shiqi, et al.
Publicado: (2026)
por: Liu, Shiqi, et al.
Publicado: (2026)
Guided Profile Generation Improves Personalization with LLMs
por: Zhang, Jiarui
Publicado: (2024)
por: Zhang, Jiarui
Publicado: (2024)
Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards
por: Shen, Wei, et al.
Publicado: (2024)
por: Shen, Wei, et al.
Publicado: (2024)
Retrieval-Augmented Generation with Hierarchical Knowledge
por: Huang, Haoyu, et al.
Publicado: (2025)
por: Huang, Haoyu, et al.
Publicado: (2025)
RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning
por: Gehring, Jonas, et al.
Publicado: (2024)
por: Gehring, Jonas, et al.
Publicado: (2024)
Reinforcement Learning for Conversational Question Answering over Knowledge Graph
por: Wu, Mi
Publicado: (2024)
por: Wu, Mi
Publicado: (2024)
GameTraversalBenchmark: Evaluating Planning Abilities Of Large Language Models Through Traversing 2D Game Maps
por: Nasir, Muhammad Umair, et al.
Publicado: (2024)
por: Nasir, Muhammad Umair, et al.
Publicado: (2024)
EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context
por: Koo, Hamin, et al.
Publicado: (2025)
por: Koo, Hamin, et al.
Publicado: (2025)
ConTextual: Improving Clinical Text Summarization in LLMs with Context-preserving Token Filtering and Knowledge Graphs
por: Piya, Fahmida Liza, et al.
Publicado: (2025)
por: Piya, Fahmida Liza, et al.
Publicado: (2025)
MM-Eval: A Hierarchical Benchmark for Modern Mongolian Evaluation in LLMs
por: Zhang, Mengyuan, et al.
Publicado: (2024)
por: Zhang, Mengyuan, et al.
Publicado: (2024)
Chain of History: Learning and Forecasting with LLMs for Temporal Knowledge Graph Completion
por: Luo, Ruilin, et al.
Publicado: (2024)
por: Luo, Ruilin, et al.
Publicado: (2024)
Ejemplares similares
-
Position: Privacy Is Not Just Memorization!
por: Mireshghallah, Niloofar, et al.
Publicado: (2025) -
Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models
por: Liu, Xinyue, et al.
Publicado: (2026) -
Differentially Private Learning Needs Better Model Initialization and Self-Distillation
por: Ngong, Ivoline C., et al.
Publicado: (2024) -
Developing Story: Case Studies of Generative AI's Use in Journalism
por: Brigham, Natalie Grace, et al.
Publicado: (2024) -
Can LLMs Keep a Secret? Testing Privacy Implications of Language Models via Contextual Integrity Theory
por: Mireshghallah, Niloofar, et al.
Publicado: (2023)