Stateful Reasoning via Insight Replay
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lei, Bin, Ding, Caiwen, Yang, Jiachen, Li, Ang, Wang, Xin Eric |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
par: Kang, Weitai, et autres
Publié: (2025)
par: Kang, Weitai, et autres
Publié: (2025)
On the Reliability of Computer Use Agents
par: Gonzalez-Pumariega, Gonzalo, et autres
Publié: (2026)
par: Gonzalez-Pumariega, Gonzalo, et autres
Publié: (2026)
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
par: Shi, Zhenning, et autres
Publié: (2026)
par: Shi, Zhenning, et autres
Publié: (2026)
MACM: Utilizing a Multi-Agent System for Condition Mining in Solving Complex Mathematical Problems
par: Lei, Bin, et autres
Publié: (2024)
par: Lei, Bin, et autres
Publié: (2024)
Agent S: An Open Agentic Framework that Uses Computers Like a Human
par: Agashe, Saaket, et autres
Publié: (2024)
par: Agashe, Saaket, et autres
Publié: (2024)
EFRame: Deeper Reasoning via Exploration-Filter-Replay Reinforcement Learning Framework
par: Wang, Chen, et autres
Publié: (2025)
par: Wang, Chen, et autres
Publié: (2025)
Agent S2: A Compositional Generalist-Specialist Framework for Computer Use Agents
par: Agashe, Saaket, et autres
Publié: (2025)
par: Agashe, Saaket, et autres
Publié: (2025)
A 3D SAM-Based Progressive Prompting Framework for Multi-Task Segmentation of Radiotherapy-induced Normal Tissue Injuries in Limited-Data Settings
par: Jiang, Caiwen, et autres
Publié: (2026)
par: Jiang, Caiwen, et autres
Publié: (2026)
\textsc{GUI-Spotlight}: Adaptive Iterative Focus Refinement for Enhanced GUI Visual Grounding
par: Lei, Bin, et autres
Publié: (2025)
par: Lei, Bin, et autres
Publié: (2025)
MEGG: Replay via Maximally Extreme GGscore in Incremental Learning for Neural Recommendation Models
par: Shi, Yunxiao, et autres
Publié: (2025)
par: Shi, Yunxiao, et autres
Publié: (2025)
AgentHER: Hindsight Experience Replay for LLM Agent Trajectory Relabeling
par: Ding, Liang
Publié: (2026)
par: Ding, Liang
Publié: (2026)
Identification of Probabilities of Causation: from Recursive to Closed-Form Bounds
par: Shu, Xin, et autres
Publié: (2025)
par: Shu, Xin, et autres
Publié: (2025)
Catastrophic Forgetting Mitigation via Discrepancy-Weighted Experience Replay
par: Xu, Xinrun, et autres
Publié: (2025)
par: Xu, Xinrun, et autres
Publié: (2025)
Scaling Agents for Computer Use
par: Gonzalez-Pumariega, Gonzalo, et autres
Publié: (2025)
par: Gonzalez-Pumariega, Gonzalo, et autres
Publié: (2025)
From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay
par: Xiao, Yanan, et autres
Publié: (2026)
par: Xiao, Yanan, et autres
Publié: (2026)
ProActor: Timing-Aware Reinforcement Learning for Proactive Task Scheduling Agents
par: Ding, Lei, et autres
Publié: (2026)
par: Ding, Lei, et autres
Publié: (2026)
AL-GNN: Privacy-Preserving and Replay-Free Continual Graph Learning via Analytic Learning
par: Zhang, Xuling, et autres
Publié: (2025)
par: Zhang, Xuling, et autres
Publié: (2025)
Continual Offline Reinforcement Learning via Diffusion-based Dual Generative Replay
par: Liu, Jinmei, et autres
Publié: (2024)
par: Liu, Jinmei, et autres
Publié: (2024)
Teaching AI to Remember: Insights from Brain-Inspired Replay in Continual Learning
par: Kim, Jina
Publié: (2025)
par: Kim, Jina
Publié: (2025)
An Efficient Replay for Class-Incremental Learning with Pre-trained Models
par: Yin, Weimin, et autres
Publié: (2024)
par: Yin, Weimin, et autres
Publié: (2024)
InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction
par: Lei, Bin, et autres
Publié: (2025)
par: Lei, Bin, et autres
Publié: (2025)
P-Guide: Parameter-Efficient Prior Steering for Single-Pass CFG Inference
par: Peng, Xin, et autres
Publié: (2026)
par: Peng, Xin, et autres
Publié: (2026)
Enhancing Table Reasoning with Deterministic Table-State Rewards
par: Kwok, Tung Sum Thomas, et autres
Publié: (2026)
par: Kwok, Tung Sum Thomas, et autres
Publié: (2026)
GSR-GNN: Training Acceleration and Memory-Saving Framework of Deep GNNs on Circuit Graph
par: Luo, Yuebo, et autres
Publié: (2026)
par: Luo, Yuebo, et autres
Publié: (2026)
Provable Effects of Data Replay in Continual Learning: A Feature Learning Perspective
par: Ding, Meng, et autres
Publié: (2026)
par: Ding, Meng, et autres
Publié: (2026)
Sci-CoE: Co-evolving Scientific Reasoning LLMs via Geometric Consensus with Sparse Supervision
par: He, Xiaohan, et autres
Publié: (2026)
par: He, Xiaohan, et autres
Publié: (2026)
SafeCoT: Improving VLM Safety with Minimal Reasoning
par: Ma, Jiachen, et autres
Publié: (2025)
par: Ma, Jiachen, et autres
Publié: (2025)
ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay
par: Hu, Zhexin, et autres
Publié: (2026)
par: Hu, Zhexin, et autres
Publié: (2026)
SafeKey: Amplifying Aha-Moment Insights for Safety Reasoning
par: Zhou, Kaiwen, et autres
Publié: (2025)
par: Zhou, Kaiwen, et autres
Publié: (2025)
Micromobility Flow Prediction: A Bike Sharing Station-level Study via Multi-level Spatial-Temporal Attention Neural Network
par: Yang, Xi, et autres
Publié: (2025)
par: Yang, Xi, et autres
Publié: (2025)
FHE-Agent: Automating CKKS Configuration for Practical Encrypted Inference via an LLM-Guided Agentic Framework
par: Xu, Nuo, et autres
Publié: (2025)
par: Xu, Nuo, et autres
Publié: (2025)
ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates
par: Yang, Ling, et autres
Publié: (2025)
par: Yang, Ling, et autres
Publié: (2025)
SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents
par: Ding, Yifeng, et autres
Publié: (2026)
par: Ding, Yifeng, et autres
Publié: (2026)
Similar Data Points Identification with LLM: A Human-in-the-loop Strategy Using Summarization and Hidden State Insights
par: Zeng, Xianlong, et autres
Publié: (2024)
par: Zeng, Xianlong, et autres
Publié: (2024)
Are Smarter LLMs Safer? Exploring Safety-Reasoning Trade-offs in Prompting and Fine-Tuning
par: Li, Ang, et autres
Publié: (2025)
par: Li, Ang, et autres
Publié: (2025)
BPO: Staying Close to the Behavior LLM Creates Better Online LLM Alignment
par: Xu, Wenda, et autres
Publié: (2024)
par: Xu, Wenda, et autres
Publié: (2024)
G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning
par: Guo, Xiaojun, et autres
Publié: (2025)
par: Guo, Xiaojun, et autres
Publié: (2025)
Estimating Probabilities of Causation with Machine Learning Models
par: Wang, Shuai, et autres
Publié: (2025)
par: Wang, Shuai, et autres
Publié: (2025)
Prioritized Trajectory Replay: A Replay Memory for Data-driven Reinforcement Learning
par: Liu, Jinyi, et autres
Publié: (2023)
par: Liu, Jinyi, et autres
Publié: (2023)
Large Language Models in Transportation Systems Management and Operations: From Text Reasoning to Multi-modal Decision Support
par: Li, Siyan, et autres
Publié: (2026)
par: Li, Siyan, et autres
Publié: (2026)
Documents similaires
-
GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning
par: Kang, Weitai, et autres
Publié: (2025) -
On the Reliability of Computer Use Agents
par: Gonzalez-Pumariega, Gonzalo, et autres
Publié: (2026) -
Internalizing LLM Reasoning via Discovery and Replay of Latent Actions
par: Shi, Zhenning, et autres
Publié: (2026) -
MACM: Utilizing a Multi-Agent System for Condition Mining in Solving Complex Mathematical Problems
par: Lei, Bin, et autres
Publié: (2024) -
Agent S: An Open Agentic Framework that Uses Computers Like a Human
par: Agashe, Saaket, et autres
Publié: (2024)