Democratizing Tool Learning with Environments Fully Simulated by a Free 8B Language Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Tang, Chenming, Huang, Hsiu-Yuan, Liu, Weijie, Zheng, Junqiang, Yang, Saiyong, Wu, Yunfang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error
por: Tang, Chenming, et al.
Publicado: (2025)
por: Tang, Chenming, et al.
Publicado: (2025)
Think Outside the Policy: In-Context Steered Policy Optimization
por: Huang, Hsiu-Yuan, et al.
Publicado: (2025)
por: Huang, Hsiu-Yuan, et al.
Publicado: (2025)
CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark
por: Zhang, Junzhao, et al.
Publicado: (2026)
por: Zhang, Junzhao, et al.
Publicado: (2026)
Evaluating the Capability of Large-scale Language Models on Chinese Grammatical Error Correction Task
por: Qu, Fanyi, et al.
Publicado: (2023)
por: Qu, Fanyi, et al.
Publicado: (2023)
Aligning Language Models with Real-time Knowledge Editing
por: Tang, Chenming, et al.
Publicado: (2025)
por: Tang, Chenming, et al.
Publicado: (2025)
Beyond Spurious Signals: Debiasing Multimodal Large Language Models via Counterfactual Inference and Adaptive Expert Routing
por: Wu, Zichen, et al.
Publicado: (2025)
por: Wu, Zichen, et al.
Publicado: (2025)
ADWIN: Adaptive Windows for Horizon-Aware On-Policy Distillation
por: Liang, Kun, et al.
Publicado: (2026)
por: Liang, Kun, et al.
Publicado: (2026)
Large Language Models Might Not Care What You Are Saying: Prompt Format Beats Descriptions
por: Tang, Chenming, et al.
Publicado: (2024)
por: Tang, Chenming, et al.
Publicado: (2024)
Ungrammatical-syntax-based In-context Example Selection for Grammatical Error Correction
por: Tang, Chenming, et al.
Publicado: (2024)
por: Tang, Chenming, et al.
Publicado: (2024)
SCOI: Syntax-augmented Coverage-based In-context Example Selection for Machine Translation
por: Tang, Chenming, et al.
Publicado: (2024)
por: Tang, Chenming, et al.
Publicado: (2024)
Going Beyond Word Matching: Syntax Improves In-context Example Selection for Machine Translation
por: Tang, Chenming, et al.
Publicado: (2024)
por: Tang, Chenming, et al.
Publicado: (2024)
Assessing the Performance of Chinese Open Source Large Language Models in Information Extraction Tasks
por: Cai, Yida, et al.
Publicado: (2024)
por: Cai, Yida, et al.
Publicado: (2024)
Lost in the Passage: Passage-level In-context Learning Does Not Necessarily Need a "Passage"
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Mixture-of-Prompt-Experts for Multi-modal Semantic Understanding
por: Wu, Zichen, et al.
Publicado: (2024)
por: Wu, Zichen, et al.
Publicado: (2024)
FPT: Feature Prompt Tuning for Few-shot Readability Assessment
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
ORBIT: On-policy Exploration-Exploitation for Controllable Multi-Budget Reasoning
por: Liang, Kun, et al.
Publicado: (2026)
por: Liang, Kun, et al.
Publicado: (2026)
Beyond Demonstrations: Dynamic Vector Construction from Latent Representations
por: Cai, Wang, et al.
Publicado: (2025)
por: Cai, Wang, et al.
Publicado: (2025)
A Survey of Uncertainty Estimation in LLMs: Theory Meets Practice
por: Huang, Hsiu-Yuan, et al.
Publicado: (2024)
por: Huang, Hsiu-Yuan, et al.
Publicado: (2024)
Unlocking the Power of LLM Uncertainty for Active In-Context Example Selection
por: Huang, Hsiu-Yuan, et al.
Publicado: (2024)
por: Huang, Hsiu-Yuan, et al.
Publicado: (2024)
Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models
por: Xu, Xin, et al.
Publicado: (2026)
por: Xu, Xin, et al.
Publicado: (2026)
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation
por: Yang, Wenkai, et al.
Publicado: (2026)
por: Yang, Wenkai, et al.
Publicado: (2026)
LaSeR: Reinforcement Learning with Last-Token Self-Rewarding
por: Yang, Wenkai, et al.
Publicado: (2025)
por: Yang, Wenkai, et al.
Publicado: (2025)
Unsupervised Distractor Generation via Large Language Model Distilling and Counterfactual Contrastive Decoding
por: Qu, Fanyi, et al.
Publicado: (2024)
por: Qu, Fanyi, et al.
Publicado: (2024)
Thinking-Free Policy Initialization Makes Distilled Reasoning Models More Effective and Efficient Reasoners
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation
por: Yang, Yutong, et al.
Publicado: (2026)
por: Yang, Yutong, et al.
Publicado: (2026)
Not All Tokens Learn Alike: Attention Entropy Reveals Heterogeneous Signals in RL Reasoning
por: Li, Gengyang, et al.
Publicado: (2026)
por: Li, Gengyang, et al.
Publicado: (2026)
Enhancing Tool Learning in Large Language Models with Hierarchical Error Checklists
por: Cui, Yue, et al.
Publicado: (2025)
por: Cui, Yue, et al.
Publicado: (2025)
SyncThink: A Training-Free Strategy to Align Inference Termination with Reasoning Saturation
por: Li, Gengyang, et al.
Publicado: (2026)
por: Li, Gengyang, et al.
Publicado: (2026)
ThinkLess: A Training-Free Inference-Efficient Method for Reducing Reasoning Redundancy
por: Li, Gengyang, et al.
Publicado: (2025)
por: Li, Gengyang, et al.
Publicado: (2025)
OKBench: Democratizing LLM Evaluation with Fully Automated, On-Demand, Open Knowledge Benchmarking
por: Li, Yanhong, et al.
Publicado: (2025)
por: Li, Yanhong, et al.
Publicado: (2025)
Composable Cross-prompt Essay Scoring by Merging Models
por: Lee, Sanwoo, et al.
Publicado: (2025)
por: Lee, Sanwoo, et al.
Publicado: (2025)
Unleashing Large Language Models' Proficiency in Zero-shot Essay Scoring
por: Lee, Sanwoo, et al.
Publicado: (2024)
por: Lee, Sanwoo, et al.
Publicado: (2024)
OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Data
por: Du, Yuwen, et al.
Publicado: (2026)
por: Du, Yuwen, et al.
Publicado: (2026)
GenTool: Enhancing Tool Generalization in Language Models through Zero-to-One and Weak-to-Strong Simulation
por: He, Jie, et al.
Publicado: (2025)
por: He, Jie, et al.
Publicado: (2025)
PLPP: Prompt Learning with Perplexity Is Self-Distillation for Vision-Language Models
por: Liu, Biao, et al.
Publicado: (2024)
por: Liu, Biao, et al.
Publicado: (2024)
LLM4Causal: Democratized Causal Tools for Everyone via Large Language Model
por: Jiang, Haitao, et al.
Publicado: (2023)
por: Jiang, Haitao, et al.
Publicado: (2023)
Rank-Then-Score: Enhancing Large Language Models for Automated Essay Scoring
por: Cai, Yida, et al.
Publicado: (2025)
por: Cai, Yida, et al.
Publicado: (2025)
Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
por: Apertus, Project, et al.
Publicado: (2025)
por: Apertus, Project, et al.
Publicado: (2025)
Instruct Large Language Models to Drive like Humans
por: Zhang, Ruijun, et al.
Publicado: (2024)
por: Zhang, Ruijun, et al.
Publicado: (2024)
StableToolBench-MirrorAPI: Modeling Tool Environments as Mirrors of 7,000+ Real-World APIs
por: Guo, Zhicheng, et al.
Publicado: (2025)
por: Guo, Zhicheng, et al.
Publicado: (2025)
Ejemplares similares
-
Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error
por: Tang, Chenming, et al.
Publicado: (2025) -
Think Outside the Policy: In-Context Steered Policy Optimization
por: Huang, Hsiu-Yuan, et al.
Publicado: (2025) -
CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark
por: Zhang, Junzhao, et al.
Publicado: (2026) -
Evaluating the Capability of Large-scale Language Models on Chinese Grammatical Error Correction Task
por: Qu, Fanyi, et al.
Publicado: (2023) -
Aligning Language Models with Real-time Knowledge Editing
por: Tang, Chenming, et al.
Publicado: (2025)