The Use of AI Tools to Develop and Validate Q-Matrices
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fan, Kevin, Bialo, Jacquelyn A., Li, Hongli |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ToolRM: Towards Agentic Tool-Use Reward Modeling
par: Li, Renhao, et autres
Publié: (2025)
par: Li, Renhao, et autres
Publié: (2025)
TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
par: Chen, Yongchao, et autres
Publié: (2025)
par: Chen, Yongchao, et autres
Publié: (2025)
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
par: Wang, Yuxin, et autres
Publié: (2025)
par: Wang, Yuxin, et autres
Publié: (2025)
SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use
par: Jeon, Changhyun, et autres
Publié: (2025)
par: Jeon, Changhyun, et autres
Publié: (2025)
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
par: Feng, Jiazhan, et autres
Publié: (2025)
par: Feng, Jiazhan, et autres
Publié: (2025)
Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger
par: Li, Wenjun, et autres
Publié: (2025)
par: Li, Wenjun, et autres
Publié: (2025)
GTA-2: Benchmarking General Tool Agents from Atomic Tool-Use to Open-Ended Workflows
par: Wang, Jize, et autres
Publié: (2026)
par: Wang, Jize, et autres
Publié: (2026)
Evaluation of AI Ethics Tools in Language Models: A Developers' Perspective Case Study
par: Silva, Jhessica, et autres
Publié: (2025)
par: Silva, Jhessica, et autres
Publié: (2025)
Developing Story: Case Studies of Generative AI's Use in Journalism
par: Brigham, Natalie Grace, et autres
Publié: (2024)
par: Brigham, Natalie Grace, et autres
Publié: (2024)
Learning How to Use Tools, Not Just When: Pattern-Aware Tool-Integrated Reasoning
par: Xu, Ningning, et autres
Publié: (2025)
par: Xu, Ningning, et autres
Publié: (2025)
TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Benchmarking LLM Tool-Use in the Wild
par: Yu, Peijie, et autres
Publié: (2026)
par: Yu, Peijie, et autres
Publié: (2026)
MMedAgent: Learning to Use Medical Tools with Multi-modal Agent
par: Li, Binxu, et autres
Publié: (2024)
par: Li, Binxu, et autres
Publié: (2024)
Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments
par: Ye, Junjie, et autres
Publié: (2025)
par: Ye, Junjie, et autres
Publié: (2025)
Use of AI Tools: Guidelines to Maintain Academic Integrity in Computing Colleges
par: El-boghdadi, Hatem M., et autres
Publié: (2026)
par: El-boghdadi, Hatem M., et autres
Publié: (2026)
CCTU: A Benchmark for Tool Use under Complex Constraints
par: Ye, Junjie, et autres
Publié: (2026)
par: Ye, Junjie, et autres
Publié: (2026)
MCPVerse: An Expansive, Real-World Benchmark for Agentic Tool Use
par: Lei, Fei, et autres
Publié: (2025)
par: Lei, Fei, et autres
Publié: (2025)
Meta-Reasoning Improves Tool Use in Large Language Models
par: Alazraki, Lisa, et autres
Publié: (2024)
par: Alazraki, Lisa, et autres
Publié: (2024)
MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents
par: Li, Zihan, et autres
Publié: (2026)
par: Li, Zihan, et autres
Publié: (2026)
Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?
par: Findeis, Arduin, et autres
Publié: (2025)
par: Findeis, Arduin, et autres
Publié: (2025)
Don't Fine-Tune, Decode: Syntax Error-Free Tool Use via Constrained Decoding
par: Zhang, Kexun, et autres
Publié: (2023)
par: Zhang, Kexun, et autres
Publié: (2023)
Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use
par: Pang, Renning, et autres
Publié: (2026)
par: Pang, Renning, et autres
Publié: (2026)
GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning
par: Wu, Jiaqi, et autres
Publié: (2025)
par: Wu, Jiaqi, et autres
Publié: (2025)
AskToAct: Enhancing LLMs Tool Use via Self-Correcting Clarification
par: Zhang, Xuan, et autres
Publié: (2025)
par: Zhang, Xuan, et autres
Publié: (2025)
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
par: Jiang, Dongfu, et autres
Publié: (2025)
par: Jiang, Dongfu, et autres
Publié: (2025)
TInR: Exploring Tool-Internalized Reasoning in Large Language Models
par: Xu, Qiancheng, et autres
Publié: (2026)
par: Xu, Qiancheng, et autres
Publié: (2026)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
par: Xu, Qiancheng, et autres
Publié: (2025)
par: Xu, Qiancheng, et autres
Publié: (2025)
FinMCP-Bench: Benchmarking LLM Agents for Real-World Financial Tool Use under the Model Context Protocol
par: Zhu, Jie, et autres
Publié: (2026)
par: Zhu, Jie, et autres
Publié: (2026)
ToolSandbox: A Stateful, Conversational, Interactive Evaluation Benchmark for LLM Tool Use Capabilities
par: Lu, Jiarui, et autres
Publié: (2024)
par: Lu, Jiarui, et autres
Publié: (2024)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
par: Ye, Junjie, et autres
Publié: (2024)
par: Ye, Junjie, et autres
Publié: (2024)
Process Reward Model with Q-Value Rankings
par: Li, Wendi, et autres
Publié: (2024)
par: Li, Wendi, et autres
Publié: (2024)
Sanity Checks for Long-Form Hallucination Detection
par: Zollicoffer, Geigh, et autres
Publié: (2026)
par: Zollicoffer, Geigh, et autres
Publié: (2026)
Can AI Validate Science? Benchmarking LLMs for Accurate Scientific Claim $\rightarrow$ Evidence Reasoning
par: Javaji, Shashidhar Reddy, et autres
Publié: (2025)
par: Javaji, Shashidhar Reddy, et autres
Publié: (2025)
iTool: Reinforced Fine-Tuning with Dynamic Deficiency Calibration for Advanced Tool Use
par: Zeng, Yirong, et autres
Publié: (2025)
par: Zeng, Yirong, et autres
Publié: (2025)
SPRI: Aligning Large Language Models with Context-Situated Principles
par: Zhan, Hongli, et autres
Publié: (2025)
par: Zhan, Hongli, et autres
Publié: (2025)
Toward Efficient Agents: Memory, Tool learning, and Planning
par: Yang, Xiaofang, et autres
Publié: (2026)
par: Yang, Xiaofang, et autres
Publié: (2026)
Evaluating Patient Safety Risks in Generative AI: Development and Validation of a FMECA Framework for Generated Clinical Content
par: Bednarczyk, Lydie, et autres
Publié: (2026)
par: Bednarczyk, Lydie, et autres
Publié: (2026)
MENTOR: A Reinforcement Learning Framework for Enabling Tool Use in Small Models via Teacher-Optimized Rewards
par: Choi, ChangSu, et autres
Publié: (2025)
par: Choi, ChangSu, et autres
Publié: (2025)
DICE-BENCH: Evaluating the Tool-Use Capabilities of Large Language Models in Multi-Round, Multi-Party Dialogues
par: Jang, Kyochul, et autres
Publié: (2025)
par: Jang, Kyochul, et autres
Publié: (2025)
Development and Validation of Engagement and Rapport Scales for Evaluating User Experience in Multimodal Dialogue Systems
par: Kurata, Fuma, et autres
Publié: (2025)
par: Kurata, Fuma, et autres
Publié: (2025)
Documents similaires
-
ToolRM: Towards Agentic Tool-Use Reward Modeling
par: Li, Renhao, et autres
Publié: (2025) -
TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
par: Chen, Yongchao, et autres
Publié: (2025) -
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
par: Wang, Yuxin, et autres
Publié: (2025) -
SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use
par: Jeon, Changhyun, et autres
Publié: (2025) -
ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
par: Feng, Jiazhan, et autres
Publié: (2025)