Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Zhihao, Li, Rumei, Li, Jiahuan, Weng, Rongxiang, Wang, Jingang, Cai, Xunliang, Wang, Xiting |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
A Survey on LLM Mid-Training
por: Tu, Chengying, et al.
Publicado: (2025)
por: Tu, Chengying, et al.
Publicado: (2025)
FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training
por: Xu, Liangyu, et al.
Publicado: (2025)
por: Xu, Liangyu, et al.
Publicado: (2025)
Large-Scale Diverse Synthesis for Mid-Training
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategy
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
por: Diao, Muxi, et al.
Publicado: (2024)
por: Diao, Muxi, et al.
Publicado: (2024)
Libra: Assessing and Improving Reward Model by Learning to Think
por: Zhou, Meng, et al.
Publicado: (2025)
por: Zhou, Meng, et al.
Publicado: (2025)
Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
Length Desensitization in Direct Preference Optimization
por: Liu, Wei, et al.
Publicado: (2024)
por: Liu, Wei, et al.
Publicado: (2024)
Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns
por: Zhang, Xuemiao, et al.
Publicado: (2025)
por: Zhang, Xuemiao, et al.
Publicado: (2025)
Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization
por: Bai, Yang, et al.
Publicado: (2026)
por: Bai, Yang, et al.
Publicado: (2026)
Speculative Decoding via Early-exiting for Faster LLM Inference with Thompson Sampling Control Mechanism
por: Liu, Jiahao, et al.
Publicado: (2024)
por: Liu, Jiahao, et al.
Publicado: (2024)
Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training
por: Wang, Zhijun, et al.
Publicado: (2025)
por: Wang, Zhijun, et al.
Publicado: (2025)
LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance
por: Fan, Yuchun, et al.
Publicado: (2026)
por: Fan, Yuchun, et al.
Publicado: (2026)
MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks
por: Ruan, Junhao, et al.
Publicado: (2026)
por: Ruan, Junhao, et al.
Publicado: (2026)
Uncovering Safety Risks of Large Language Models through Concept Activation Vector
por: Xu, Zhihao, et al.
Publicado: (2024)
por: Xu, Zhihao, et al.
Publicado: (2024)
Dynamic Fisher-weighted Model Merging via Bayesian Optimization
por: Lee, Sanwoo, et al.
Publicado: (2025)
por: Lee, Sanwoo, et al.
Publicado: (2025)
ReMamba: Equip Mamba with Effective Long-Sequence Modeling
por: Yuan, Danlong, et al.
Publicado: (2024)
por: Yuan, Danlong, et al.
Publicado: (2024)
REWARD CONSISTENCY: Improving Multi-Objective Alignment from a Data-Centric Perspective
por: Xu, Zhihao, et al.
Publicado: (2025)
por: Xu, Zhihao, et al.
Publicado: (2025)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
por: Tang, Hongyin, et al.
Publicado: (2024)
por: Tang, Hongyin, et al.
Publicado: (2024)
Earlier Tokens Contribute More: Learning Direct Preference Optimization From Temporal Decay Perspective
por: Shao, Ruichen, et al.
Publicado: (2025)
por: Shao, Ruichen, et al.
Publicado: (2025)
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
por: Wu, Pengfei, et al.
Publicado: (2024)
por: Wu, Pengfei, et al.
Publicado: (2024)
FIRP: Faster LLM inference via future intermediate representation prediction
por: Wu, Pengfei, et al.
Publicado: (2024)
por: Wu, Pengfei, et al.
Publicado: (2024)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
por: Zhang, Jiazheng, et al.
Publicado: (2025)
por: Zhang, Jiazheng, et al.
Publicado: (2025)
Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation
por: Liu, Xiaochuan, et al.
Publicado: (2025)
por: Liu, Xiaochuan, et al.
Publicado: (2025)
Beyond the Known: Investigating LLMs Performance on Out-of-Domain Intent Detection
por: Wang, Pei, et al.
Publicado: (2024)
por: Wang, Pei, et al.
Publicado: (2024)
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
por: Wang, Lanrui, et al.
Publicado: (2025)
por: Wang, Lanrui, et al.
Publicado: (2025)
Efficient Context Scaling with LongCat ZigZag Attention
por: Zhang, Chen, et al.
Publicado: (2025)
por: Zhang, Chen, et al.
Publicado: (2025)
Unlocking the Power of GANs in Non-Autoregressive Text Generation
por: Ren, Da, et al.
Publicado: (2023)
por: Ren, Da, et al.
Publicado: (2023)
Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories
por: Liu, Peiyang, et al.
Publicado: (2026)
por: Liu, Peiyang, et al.
Publicado: (2026)
APP: Adaptive Prototypical Pseudo-Labeling for Few-shot OOD Detection
por: Wang, Pei, et al.
Publicado: (2023)
por: Wang, Pei, et al.
Publicado: (2023)
Graph-Structured Speculative Decoding
por: Gong, Zhuocheng, et al.
Publicado: (2024)
por: Gong, Zhuocheng, et al.
Publicado: (2024)
Disentangling Preference Representation and Text Generation for Efficient Individual Preference Alignment
por: Zhang, Jianfei, et al.
Publicado: (2024)
por: Zhang, Jianfei, et al.
Publicado: (2024)
LongCat-Flash-Prover: Advancing Native Formal Reasoning via Agentic Tool-Integrated Reinforcement Learning
por: Wang, Jianing, et al.
Publicado: (2026)
por: Wang, Jianing, et al.
Publicado: (2026)
A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention
por: Xiu, Di, et al.
Publicado: (2025)
por: Xiu, Di, et al.
Publicado: (2025)
Predictor-Corrector Enhanced Transformers with Exponential Moving Average Coefficient Learning
por: Li, Bei, et al.
Publicado: (2024)
por: Li, Bei, et al.
Publicado: (2024)
Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents
por: Wang, Ziyi, et al.
Publicado: (2026)
por: Wang, Ziyi, et al.
Publicado: (2026)
Implicit Hierarchical GRPO: Decoupling Tool Invocation from Execution for Tool-Integrated Mathematical Reasoning
por: Wang, Li, et al.
Publicado: (2026)
por: Wang, Li, et al.
Publicado: (2026)
TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM
por: Zhou, Haoyang, et al.
Publicado: (2026)
por: Zhou, Haoyang, et al.
Publicado: (2026)
Causal Autoregressive Diffusion Language Model
por: Ruan, Junhao, et al.
Publicado: (2026)
por: Ruan, Junhao, et al.
Publicado: (2026)
Ejemplares similares
-
LinkQA: Synthesizing Diverse QA from Multiple Seeds Strongly Linked by Knowledge Points
por: Zhang, Xuemiao, et al.
Publicado: (2025) -
A Survey on LLM Mid-Training
por: Tu, Chengying, et al.
Publicado: (2025) -
FIRE: Flexible Integration of Data Quality Ratings for Effective Pre-Training
por: Xu, Liangyu, et al.
Publicado: (2025) -
Large-Scale Diverse Synthesis for Mid-Training
por: Zhang, Xuemiao, et al.
Publicado: (2025) -
FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategy
por: Zhang, Xuemiao, et al.
Publicado: (2025)