Advancing SLM Tool-Use Capability using Reinforcement Learning
Fuente:
arXiv
Guardado en:
| Autores principales: | Paprunia, Dhruvi, Kharidia, Vansh, Doshi, Pankti |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LightFusionRec: Lightweight Transformers-Based Cross-Domain Recommendation Model
por: Kharidia, Vansh, et al.
Publicado: (2024)
por: Kharidia, Vansh, et al.
Publicado: (2024)
SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use
por: Jeon, Changhyun, et al.
Publicado: (2025)
por: Jeon, Changhyun, et al.
Publicado: (2025)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
por: Feng, Jiazhan, et al.
Publicado: (2025)
por: Feng, Jiazhan, et al.
Publicado: (2025)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
por: Zeng, Yirong, et al.
Publicado: (2025)
por: Zeng, Yirong, et al.
Publicado: (2025)
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
por: Lin, Guan-Ting, et al.
Publicado: (2024)
por: Lin, Guan-Ting, et al.
Publicado: (2024)
PEARL: Plan Exploration and Adaptive Reinforcement Learning for Multihop Tool Use
por: Wang, Qihao, et al.
Publicado: (2026)
por: Wang, Qihao, et al.
Publicado: (2026)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
por: Jiang, Dongfu, et al.
Publicado: (2025)
por: Jiang, Dongfu, et al.
Publicado: (2025)
Equipping Language Models with Tool Use Capability for Tabular Data Analysis in Finance
por: Theuma, Adrian, et al.
Publicado: (2024)
por: Theuma, Adrian, et al.
Publicado: (2024)
Improvement in Semantic Address Matching using Natural Language Processing
por: Gupta, Vansh, et al.
Publicado: (2024)
por: Gupta, Vansh, et al.
Publicado: (2024)
Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
por: Chou, Ju-Chieh, et al.
Publicado: (2025)
por: Chou, Ju-Chieh, et al.
Publicado: (2025)
GmSLM : Generative Marmoset Spoken Language Modeling
por: Sternberg, Talia, et al.
Publicado: (2025)
por: Sternberg, Talia, et al.
Publicado: (2025)
Select to Think: Unlocking SLM Potential with Local Sufficiency
por: Ye, Wenxuan, et al.
Publicado: (2026)
por: Ye, Wenxuan, et al.
Publicado: (2026)
Enhancing SLM via ChatGPT and Dataset Augmentation
por: Pieper, Tom, et al.
Publicado: (2024)
por: Pieper, Tom, et al.
Publicado: (2024)
Adaptive Tool Generation with Models as Tools and Reinforcement Learning
por: Wang, Chenpeng, et al.
Publicado: (2025)
por: Wang, Chenpeng, et al.
Publicado: (2025)
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning
por: Wu, Jiaqi, et al.
Publicado: (2025)
por: Wu, Jiaqi, et al.
Publicado: (2025)
ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities
por: Lu, Jiarui, et al.
Publicado: (2024)
por: Lu, Jiarui, et al.
Publicado: (2024)
PUB: A Pragmatics Understanding Benchmark for Assessing LLMs' Pragmatics Capabilities
por: Sravanthi, Settaluri Lakshmi, et al.
Publicado: (2024)
por: Sravanthi, Settaluri Lakshmi, et al.
Publicado: (2024)
SLM-SQL: An Exploration of Small Language Models for Text-to-SQL
por: Sheng, Lei, et al.
Publicado: (2025)
por: Sheng, Lei, et al.
Publicado: (2025)
CorrectionLM: Self-Corrections with SLM for Dialogue State Tracking
por: Lee, Chia-Hsuan, et al.
Publicado: (2024)
por: Lee, Chia-Hsuan, et al.
Publicado: (2024)
Process-Supervised Reinforcement Learning for Interactive Multimodal Tool-Use Agents
por: Tan, Weiting, et al.
Publicado: (2025)
por: Tan, Weiting, et al.
Publicado: (2025)
LegoSLM: Connecting LLM with Speech Encoder using CTC Posteriors
por: Ma, Rao, et al.
Publicado: (2025)
por: Ma, Rao, et al.
Publicado: (2025)
ToolMem: Enhancing Multimodal Agents with Learnable Tool Capability Memory
por: Xiao, Yunzhong, et al.
Publicado: (2025)
por: Xiao, Yunzhong, et al.
Publicado: (2025)
Exploring Topic Trends in COVID-19 Research Literature using Non-Negative Matrix Factorization
por: Patel, Divya, et al.
Publicado: (2025)
por: Patel, Divya, et al.
Publicado: (2025)
SLM4Offer: Personalized Marketing Offer Generation Using Contrastive Learning Based Fine-Tuning
por: Challapalli, Vedasamhitha, et al.
Publicado: (2025)
por: Challapalli, Vedasamhitha, et al.
Publicado: (2025)
Beyond Accuracy: Risk-Sensitive Evaluation of Hallucinated Medical Advice
por: Doshi, Savan
Publicado: (2026)
por: Doshi, Savan
Publicado: (2026)
SLM-Mod: Small Language Models Surpass LLMs at Content Moderation
por: Zhan, Xianyang, et al.
Publicado: (2024)
por: Zhan, Xianyang, et al.
Publicado: (2024)
Learning to Use Tools via Cooperative and Interactive Agents
por: Shi, Zhengliang, et al.
Publicado: (2024)
por: Shi, Zhengliang, et al.
Publicado: (2024)
SHARE: An SLM-based Hierarchical Action CorREction Assistant for Text-to-SQL
por: Qu, Ge, et al.
Publicado: (2025)
por: Qu, Ge, et al.
Publicado: (2025)
SLM as Guardian: Pioneering AI Safety with Small Language Models
por: Kwon, Ohjoon, et al.
Publicado: (2024)
por: Kwon, Ohjoon, et al.
Publicado: (2024)
More Than a Quick Glance: Overcoming the Greedy Bias in KV-Cache Compression
por: Sood, Aryan, et al.
Publicado: (2026)
por: Sood, Aryan, et al.
Publicado: (2026)
The Tool Illusion: Rethinking Tool Use in Web Agents
por: Lou, Renze, et al.
Publicado: (2026)
por: Lou, Renze, et al.
Publicado: (2026)
DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues
por: Jang, Kyochul, et al.
Publicado: (2025)
por: Jang, Kyochul, et al.
Publicado: (2025)
MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
por: Choi, ChangSu, et al.
Publicado: (2025)
por: Choi, ChangSu, et al.
Publicado: (2025)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
por: Ye, Junjie, et al.
Publicado: (2024)
por: Ye, Junjie, et al.
Publicado: (2024)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
por: Wang, Jianing, et al.
Publicado: (2026)
por: Wang, Jianing, et al.
Publicado: (2026)
Kuwain 1.5B: An Arabic SLM via Language Injection
por: Hennara, Khalil, et al.
Publicado: (2025)
por: Hennara, Khalil, et al.
Publicado: (2025)
BioTool: A Comprehensive Tool-Calling Dataset for Enhancing Biomedical Capabilities of Large Language Models
por: Gao, Xin, et al.
Publicado: (2026)
por: Gao, Xin, et al.
Publicado: (2026)
Tool Verification for Test-Time Reinforcement Learning
por: Liao, Ruotong, et al.
Publicado: (2026)
por: Liao, Ruotong, et al.
Publicado: (2026)
StepTool: Enhancing Multi-Step Tool Usage in LLMs via Step-Grained Reinforcement Learning
por: Yu, Yuanqing, et al.
Publicado: (2024)
por: Yu, Yuanqing, et al.
Publicado: (2024)
GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment
por: Lv, Minxuan, et al.
Publicado: (2026)
por: Lv, Minxuan, et al.
Publicado: (2026)
Ejemplares similares
-
LightFusionRec: Lightweight Transformers-Based Cross-Domain Recommendation Model
por: Kharidia, Vansh, et al.
Publicado: (2024) -
SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use
por: Jeon, Changhyun, et al.
Publicado: (2025) -
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
por: Feng, Jiazhan, et al.
Publicado: (2025) -
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
por: Zeng, Yirong, et al.
Publicado: (2025) -
Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback
por: Lin, Guan-Ting, et al.
Publicado: (2024)