BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Hage, Tarjei Paule, Buehler, Markus J. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GraphAgents: Knowledge Graph-Guided Agentic AI for Cross-Domain Materials Design
di: Stewart, Isabella A., et al.
Pubblicazione: (2026)
di: Stewart, Isabella A., et al.
Pubblicazione: (2026)
Agentic Deep Graph Reasoning Yields Self-Organizing Knowledge Networks
di: Buehler, Markus J.
Pubblicazione: (2025)
di: Buehler, Markus J.
Pubblicazione: (2025)
Higher-Order Knowledge Representations for Agentic Scientific Reasoning
di: Stewart, Isabella A., et al.
Pubblicazione: (2026)
di: Stewart, Isabella A., et al.
Pubblicazione: (2026)
Accelerating Scientific Discovery with Generative Knowledge Extraction, Graph-Based Representation, and Multimodal Intelligent Graph Reasoning
di: Buehler, Markus J.
Pubblicazione: (2024)
di: Buehler, Markus J.
Pubblicazione: (2024)
Graph-Aware Isomorphic Attention for Adaptive Dynamics in Transformers
di: Buehler, Markus J.
Pubblicazione: (2025)
di: Buehler, Markus J.
Pubblicazione: (2025)
Self-Revising Discovery Systems for Science: A Categorical Framework for Agentic Artificial Intelligence
di: Wang, Fiona Y., et al.
Pubblicazione: (2026)
di: Wang, Fiona Y., et al.
Pubblicazione: (2026)
SciAgents: Automating scientific discovery through multi-agent intelligent graph reasoning
di: Ghafarollahi, Alireza, et al.
Pubblicazione: (2024)
di: Ghafarollahi, Alireza, et al.
Pubblicazione: (2024)
PRefLexOR: Preference-based Recursive Language Modeling for Exploratory Optimization of Reasoning and Agentic Thinking
di: Buehler, Markus J.
Pubblicazione: (2024)
di: Buehler, Markus J.
Pubblicazione: (2024)
In-situ graph reasoning and knowledge expansion using Graph-PReFLexOR
di: Buehler, Markus J.
Pubblicazione: (2025)
di: Buehler, Markus J.
Pubblicazione: (2025)
Fine-tuning large language models for domain adaptation: Exploration of training strategies, scaling, model merging and synergistic capabilities
di: Lu, Wei, et al.
Pubblicazione: (2024)
di: Lu, Wei, et al.
Pubblicazione: (2024)
Autonomous Inorganic Materials Discovery via Multi-Agent Physics-Aware Scientific Reasoning
di: Ghafarollahi, Alireza, et al.
Pubblicazione: (2025)
di: Ghafarollahi, Alireza, et al.
Pubblicazione: (2025)
Sparks: Multi-Agent Artificial Intelligence Model Discovers Protein Design Principles
di: Ghafarollahi, Alireza, et al.
Pubblicazione: (2025)
di: Ghafarollahi, Alireza, et al.
Pubblicazione: (2025)
Blockwise Advantage Estimation for Multi-Objective RL with Verifiable Rewards
di: Pavlenko, Kirill, et al.
Pubblicazione: (2026)
di: Pavlenko, Kirill, et al.
Pubblicazione: (2026)
Are LLMs Ready for Real-World Materials Discovery?
di: Miret, Santiago, et al.
Pubblicazione: (2024)
di: Miret, Santiago, et al.
Pubblicazione: (2024)
Generative Artificial Intelligence Extracts Structure-Function Relationships from Plants for New Materials
di: Luu, Rachel K., et al.
Pubblicazione: (2025)
di: Luu, Rachel K., et al.
Pubblicazione: (2025)
RL Tango: Reinforcing Generator and Verifier Together for Language Reasoning
di: Zha, Kaiwen, et al.
Pubblicazione: (2025)
di: Zha, Kaiwen, et al.
Pubblicazione: (2025)
Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling
di: Hyun, Lee, et al.
Pubblicazione: (2025)
di: Hyun, Lee, et al.
Pubblicazione: (2025)
Evaluating the Performance and Robustness of LLMs in Materials Science Q&A and Property Predictions
di: Wang, Hongchen, et al.
Pubblicazione: (2024)
di: Wang, Hongchen, et al.
Pubblicazione: (2024)
FlowRL: Matching Reward Distributions for LLM Reasoning
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
di: Zhu, Xuekai, et al.
Pubblicazione: (2025)
REASONING GYM: Reasoning Environments for Reinforcement Learning with Verifiable Rewards
di: Stojanovski, Zafir, et al.
Pubblicazione: (2025)
di: Stojanovski, Zafir, et al.
Pubblicazione: (2025)
Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards
di: Li, Ming, et al.
Pubblicazione: (2025)
di: Li, Ming, et al.
Pubblicazione: (2025)
On Designing Effective RL Reward at Training Time for LLM Reasoning
di: Gao, Jiaxuan, et al.
Pubblicazione: (2024)
di: Gao, Jiaxuan, et al.
Pubblicazione: (2024)
Matter-of-Fact: A Benchmark for Verifying the Feasibility of Literature-Supported Claims in Materials Science
di: Jansen, Peter, et al.
Pubblicazione: (2025)
di: Jansen, Peter, et al.
Pubblicazione: (2025)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
di: Ma, Zhengzhao, et al.
Pubblicazione: (2026)
X-LoRA: Mixture of Low-Rank Adapter Experts, a Flexible Framework for Large Language Models with Applications in Protein Mechanics and Molecular Design
di: Buehler, Eric L., et al.
Pubblicazione: (2024)
di: Buehler, Eric L., et al.
Pubblicazione: (2024)
Cephalo: Multi-Modal Vision-Language Models for Bio-Inspired Materials Analysis and Design
di: Buehler, Markus J.
Pubblicazione: (2024)
di: Buehler, Markus J.
Pubblicazione: (2024)
Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
di: Wen, Xuexiang, et al.
Pubblicazione: (2026)
di: Wen, Xuexiang, et al.
Pubblicazione: (2026)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
di: Peng, Miao, et al.
Pubblicazione: (2025)
di: Peng, Miao, et al.
Pubblicazione: (2025)
LifeGPT: Topology-Agnostic Generative Pretrained Transformer Model for Cellular Automata
di: Berkovich, Jaime A., et al.
Pubblicazione: (2024)
di: Berkovich, Jaime A., et al.
Pubblicazione: (2024)
A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning
di: Wachi, Akifumi, et al.
Pubblicazione: (2026)
di: Wachi, Akifumi, et al.
Pubblicazione: (2026)
AgentV-RL: Scaling Reward Modeling with Agentic Verifier
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
di: Zhang, Jiazheng, et al.
Pubblicazione: (2026)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
di: Liu, Yixin, et al.
Pubblicazione: (2026)
di: Liu, Yixin, et al.
Pubblicazione: (2026)
Hierarchical Multi-agent Large Language Model Reasoning for Autonomous Functional Materials Discovery
di: Rothfarb, Samuel, et al.
Pubblicazione: (2025)
di: Rothfarb, Samuel, et al.
Pubblicazione: (2025)
Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
di: Wen, Xumeng, et al.
Pubblicazione: (2025)
Language-Native Materials Processing Design by Lightly Structured Text Database and Reasoning Large Language Model
di: Liu, Yuze, et al.
Pubblicazione: (2025)
di: Liu, Yuze, et al.
Pubblicazione: (2025)
Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning
di: Pronesti, Massimiliano, et al.
Pubblicazione: (2026)
di: Pronesti, Massimiliano, et al.
Pubblicazione: (2026)
GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL
di: Yang, Rui, et al.
Pubblicazione: (2026)
di: Yang, Rui, et al.
Pubblicazione: (2026)
CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution
di: Pan, Teng, et al.
Pubblicazione: (2026)
di: Pan, Teng, et al.
Pubblicazione: (2026)
Improving Neutral Point-of-View Generation with Data- and Parameter-Efficient RL
di: Hoffmann, Jessica, et al.
Pubblicazione: (2025)
di: Hoffmann, Jessica, et al.
Pubblicazione: (2025)
ProofSketch: Efficient Verified Reasoning for Large Language Models
di: Sheshanarayana, Disha, et al.
Pubblicazione: (2025)
di: Sheshanarayana, Disha, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GraphAgents: Knowledge Graph-Guided Agentic AI for Cross-Domain Materials Design
di: Stewart, Isabella A., et al.
Pubblicazione: (2026) -
Agentic Deep Graph Reasoning Yields Self-Organizing Knowledge Networks
di: Buehler, Markus J.
Pubblicazione: (2025) -
Higher-Order Knowledge Representations for Agentic Scientific Reasoning
di: Stewart, Isabella A., et al.
Pubblicazione: (2026) -
Accelerating Scientific Discovery with Generative Knowledge Extraction, Graph-Based Representation, and Multimodal Intelligent Graph Reasoning
di: Buehler, Markus J.
Pubblicazione: (2024) -
Graph-Aware Isomorphic Attention for Adaptive Dynamics in Transformers
di: Buehler, Markus J.
Pubblicazione: (2025)