GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Sijia, Huang, Yuchen, Liu, Zifan, Li, Yanping, Fu, Jingjing, Zhao, Li, Bian, Jiang, Zhang, Ling, Zhang, Jun, Wang, Rui |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
by: Li, Sijia, et al.
Published: (2025)
by: Li, Sijia, et al.
Published: (2025)
TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning
by: Pan, Muyu, et al.
Published: (2026)
by: Pan, Muyu, et al.
Published: (2026)
Pruning then Reweighting: Towards Data-Efficient Training of Diffusion Models
by: Li, Yize, et al.
Published: (2024)
by: Li, Yize, et al.
Published: (2024)
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
by: Yang, Wei, et al.
Published: (2025)
by: Yang, Wei, et al.
Published: (2025)
What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models
by: Peng, Yuanfang, et al.
Published: (2026)
by: Peng, Yuanfang, et al.
Published: (2026)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
by: Li, Zijian, et al.
Published: (2025)
by: Li, Zijian, et al.
Published: (2025)
PixelCraft: A Multi-Agent System for High-Fidelity Visual Reasoning on Structured Images
by: Zhang, Shuoshuo, et al.
Published: (2025)
by: Zhang, Shuoshuo, et al.
Published: (2025)
Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting
by: Shen, Si, et al.
Published: (2025)
by: Shen, Si, et al.
Published: (2025)
The Power of Few: Accelerating and Enhancing Data Reweighting with Coreset Selection
by: Jafari, Mohammad, et al.
Published: (2024)
by: Jafari, Mohammad, et al.
Published: (2024)
Multi-Granularity Open Intent Classification via Adaptive Granular-Ball Decision Boundary
by: Li, Yanhua, et al.
Published: (2024)
by: Li, Yanhua, et al.
Published: (2024)
GEAR: GEometry-motion Alternating Refinement for Articulated Object Modeling with Gaussian Splatting
by: Li, Jialin, et al.
Published: (2026)
by: Li, Jialin, et al.
Published: (2026)
Visual-Advantage On-Policy Distillation for Vision-Language Models
by: Liu, Ruiqi, et al.
Published: (2026)
by: Liu, Ruiqi, et al.
Published: (2026)
GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM
by: Kang, Hao, et al.
Published: (2024)
by: Kang, Hao, et al.
Published: (2024)
GEAR: Geography-knowledge Enhanced Analog Recognition Framework in Extreme Environments
by: Liu, Zelin, et al.
Published: (2026)
by: Liu, Zelin, et al.
Published: (2026)
Puzzle it Out: Local-to-Global World Model for Offline Multi-Agent Reinforcement Learning
by: Li, Sijia, et al.
Published: (2026)
by: Li, Sijia, et al.
Published: (2026)
GEAR: A General Evaluation Framework for Abductive Reasoning
by: He, Kaiyu, et al.
Published: (2025)
by: He, Kaiyu, et al.
Published: (2025)
MACD: Multi-Agent Clinical Diagnosis with Self-Learned Knowledge for LLM
by: Li, Wenliang, et al.
Published: (2025)
by: Li, Wenliang, et al.
Published: (2025)
AdaSwitch: Balancing Exploration and Guidance in Knowledge Distillation via Adaptive Switching
by: Peng, Jingyu, et al.
Published: (2025)
by: Peng, Jingyu, et al.
Published: (2025)
Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching
by: Li, Xiang, et al.
Published: (2026)
by: Li, Xiang, et al.
Published: (2026)
Multi-Granularity Semantic Revision for Large Language Model Distillation
by: Liu, Xiaoyu, et al.
Published: (2024)
by: Liu, Xiaoyu, et al.
Published: (2024)
Token-level Data Selection for Safe LLM Fine-tuning
by: Li, Yanping, et al.
Published: (2026)
by: Li, Yanping, et al.
Published: (2026)
ScaleBiO: Scalable Bilevel Optimization for LLM Data Reweighting
by: Pan, Rui, et al.
Published: (2024)
by: Pan, Rui, et al.
Published: (2024)
FinGEAR: Financial Mapping-Guided Enhanced Answer Retrieval
by: Li, Ying, et al.
Published: (2025)
by: Li, Ying, et al.
Published: (2025)
VistaDepth: Improving far-range Depth Estimation with Spectral Modulation and Adaptive Reweighting
by: Zhan, Mingxia, et al.
Published: (2025)
by: Zhan, Mingxia, et al.
Published: (2025)
SAMKD: Spatial-aware Adaptive Masking Knowledge Distillation for Object Detection
by: Zhang, Zhourui, et al.
Published: (2025)
by: Zhang, Zhourui, et al.
Published: (2025)
Exploring Criteria of Loss Reweighting to Enhance LLM Unlearning
by: Yang, Puning, et al.
Published: (2025)
by: Yang, Puning, et al.
Published: (2025)
SkillLens: Adaptive Multi-Granularity Skill Reuse for Cost-Efficient LLM Agents
by: Miao, Yongliang, et al.
Published: (2026)
by: Miao, Yongliang, et al.
Published: (2026)
Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning
by: Ke, Junlong, et al.
Published: (2026)
by: Ke, Junlong, et al.
Published: (2026)
MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucination
by: Li, Zhuo, et al.
Published: (2026)
by: Li, Zhuo, et al.
Published: (2026)
Federated Hierarchical Reinforcement Learning for Adaptive Traffic Signal Control
by: Fu, Yongjie, et al.
Published: (2025)
by: Fu, Yongjie, et al.
Published: (2025)
REDUCING VIBRATION IN GEAR HOBBING PROCESS
by: Abdufattokh Abdugofurov, et al.
Published: (2026)
by: Abdufattokh Abdugofurov, et al.
Published: (2026)
GEAR 2.0 ‐ Care Transitions
by: Manish N Shah
Published: (2024)
by: Manish N Shah
Published: (2024)
SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation
by: Luan, Wuyang, et al.
Published: (2026)
by: Luan, Wuyang, et al.
Published: (2026)
Adaptive Reasoning Executor: A Collaborative Agent System for Efficient Reasoning
by: Ling, Zehui, et al.
Published: (2025)
by: Ling, Zehui, et al.
Published: (2025)
LLM-Oriented Token-Adaptive Knowledge Distillation
by: Xie, Xurong, et al.
Published: (2025)
by: Xie, Xurong, et al.
Published: (2025)
MGS3: A Multi-Granularity Self-Supervised Code Search Framework
by: Li, Rui, et al.
Published: (2025)
by: Li, Rui, et al.
Published: (2025)
Learn to Memorize: Optimizing LLM-based Agents with Adaptive Memory Framework
by: Zhang, Zeyu, et al.
Published: (2025)
by: Zhang, Zeyu, et al.
Published: (2025)
AutoBackdoor: Automating Backdoor Attacks via LLM Agents
by: Li, Yige, et al.
Published: (2025)
by: Li, Yige, et al.
Published: (2025)
PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents
by: Zhang, Yuqun, et al.
Published: (2025)
by: Zhang, Yuqun, et al.
Published: (2025)
Multi-Granularity Class Prototype Topology Distillation for Class-Incremental Source-Free Unsupervised Domain Adaptation
by: Deng, Peihua, et al.
Published: (2024)
by: Deng, Peihua, et al.
Published: (2024)
Similar Items
-
Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory
by: Li, Sijia, et al.
Published: (2025) -
TIAR: Trajectory-Informed Advantage Reweighting for LLM Abstention Learning
by: Pan, Muyu, et al.
Published: (2026) -
Pruning then Reweighting: Towards Data-Efficient Training of Diffusion Models
by: Li, Yize, et al.
Published: (2024) -
OMGM: Orchestrate Multiple Granularities and Modalities for Efficient Multimodal Retrieval
by: Yang, Wei, et al.
Published: (2025) -
What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models
by: Peng, Yuanfang, et al.
Published: (2026)