InfoFlow: Reinforcing Search Agent Via Reward Density Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Kun, Qian, Hongjin, Liu, Zheng, Xia, Ziyi, Xiao, Shitao, Bao, Siqi, Zhao, Jun, Liu, Kang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InfoFlow: A Framework for Multi-Layer Transformer Analysis
par: Yu, Penghao, et autres
Publié: (2026)
par: Yu, Penghao, et autres
Publié: (2026)
InfoFlow KV: Information-Flow-Aware KV Recomputation for Long Context
par: Teng, Xin, et autres
Publié: (2026)
par: Teng, Xin, et autres
Publié: (2026)
Open Data Synthesis For Deep Research
par: Xia, Ziyi, et autres
Publié: (2025)
par: Xia, Ziyi, et autres
Publié: (2025)
Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information Foraging
par: Qian, Hongjin, et autres
Publié: (2025)
par: Qian, Hongjin, et autres
Publié: (2025)
BGE Landmark Embedding: A Chunking-Free Embedding Method For Retrieval Augmented Long-Context Large Language Models
par: Luo, Kun, et autres
Publié: (2024)
par: Luo, Kun, et autres
Publié: (2024)
Large Language Models as Foundations for Next-Gen Dense Retrieval: A Comprehensive Empirical Assessment
par: Luo, Kun, et autres
Publié: (2024)
par: Luo, Kun, et autres
Publié: (2024)
Does RAG Really Perform Bad For Long-Context Processing?
par: Luo, Kun, et autres
Publié: (2025)
par: Luo, Kun, et autres
Publié: (2025)
Model-Document Protocol for AI Search
par: Qian, Hongjin, et autres
Publié: (2025)
par: Qian, Hongjin, et autres
Publié: (2025)
MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning
par: Qian, Hongjin, et autres
Publié: (2025)
par: Qian, Hongjin, et autres
Publié: (2025)
General Agentic Memory Via Deep Research
par: Yan, B. Y., et autres
Publié: (2025)
par: Yan, B. Y., et autres
Publié: (2025)
Extending Llama-3's Context Ten-Fold Overnight
par: Zhang, Peitian, et autres
Publié: (2024)
par: Zhang, Peitian, et autres
Publié: (2024)
MemoBrain: Executive Memory as an Agentic Brain for Reasoning
par: Qian, Hongjin, et autres
Publié: (2026)
par: Qian, Hongjin, et autres
Publié: (2026)
InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning
par: Wei, Chengwei, et autres
Publié: (2026)
par: Wei, Chengwei, et autres
Publié: (2026)
InfoPO: Information-Driven Policy Optimization for User-Centric Agents
par: Kong, Fanqi, et autres
Publié: (2026)
par: Kong, Fanqi, et autres
Publié: (2026)
InfoCon: Concept Discovery with Generative and Discriminative Informativeness
par: Liu, Ruizhe, et autres
Publié: (2024)
par: Liu, Ruizhe, et autres
Publié: (2024)
Reinforced Internal-External Knowledge Synergistic Reasoning for Efficient Adaptive Search Agent
par: Huang, Ziyang, et autres
Publié: (2025)
par: Huang, Ziyang, et autres
Publié: (2025)
InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling
par: Miao, Yuchun, et autres
Publié: (2024)
par: Miao, Yuchun, et autres
Publié: (2024)
M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation
par: Chen, Jianlv, et autres
Publié: (2024)
par: Chen, Jianlv, et autres
Publié: (2024)
AgentFugue: Agent Scaling for Long-Horizon Tasks through Collective Reasoning
par: Hu, Yuyang, et autres
Publié: (2026)
par: Hu, Yuyang, et autres
Publié: (2026)
AgentFactory: A Self-Evolving Framework Through Executable Subagent Accumulation and Reuse
par: Zhang, Zhang, et autres
Publié: (2026)
par: Zhang, Zhang, et autres
Publié: (2026)
InfoSeeker: A Scalable Hierarchical Parallel Agent Framework for Web Information Seeking
par: Lee, Ka Yiu, et autres
Publié: (2026)
par: Lee, Ka Yiu, et autres
Publié: (2026)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
par: Men, Tianyi, et autres
Publié: (2025)
par: Men, Tianyi, et autres
Publié: (2025)
InfoAgent: Advancing Autonomous Information-Seeking Agents
par: Zhang, Gongrui, et autres
Publié: (2025)
par: Zhang, Gongrui, et autres
Publié: (2025)
Text2Reward: Reward Shaping with Language Models for Reinforcement Learning
par: Xie, Tianbao, et autres
Publié: (2023)
par: Xie, Tianbao, et autres
Publié: (2023)
R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning
par: Zhao, Qingfei, et autres
Publié: (2025)
par: Zhao, Qingfei, et autres
Publié: (2025)
Breakthrough the Suboptimal Stable Point in Value-Factorization-Based Multi-Agent Reinforcement Learning
par: Tao, Lesong, et autres
Publié: (2026)
par: Tao, Lesong, et autres
Publié: (2026)
EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling
par: Luo, Xin, et autres
Publié: (2025)
par: Luo, Xin, et autres
Publié: (2025)
Reinforced Collaboration in Multi-Agent Flow Networks
par: Wang, Zheng, et autres
Publié: (2026)
par: Wang, Zheng, et autres
Publié: (2026)
SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent
par: Hu, Yuyang, et autres
Publié: (2026)
par: Hu, Yuyang, et autres
Publié: (2026)
AutoResearchBench: Benchmarking AI Agents on Complex Scientific Literature Discovery
par: Xiong, Lei, et autres
Publié: (2026)
par: Xiong, Lei, et autres
Publié: (2026)
Balancing Rewards in Text Summarization: Multi-Objective Reinforcement Learning via HyperVolume Optimization
par: Song, Junjie, et autres
Publié: (2025)
par: Song, Junjie, et autres
Publié: (2025)
Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation
par: Liu, Yifeng, et autres
Publié: (2026)
par: Liu, Yifeng, et autres
Publié: (2026)
Multi-Agent Reinforcement Learning with Submodular Reward
par: Chen, Wenjing, et autres
Publié: (2026)
par: Chen, Wenjing, et autres
Publié: (2026)
VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval
par: Zhou, Junjie, et autres
Publié: (2024)
par: Zhou, Junjie, et autres
Publié: (2024)
Extensible Embedding: A Flexible Multipler For LLM's Context Length
par: Shao, Ninglu, et autres
Publié: (2024)
par: Shao, Ninglu, et autres
Publié: (2024)
Flexibly Scaling Large Language Models Contexts Through Extensible Tokenization
par: Shao, Ninglu, et autres
Publié: (2024)
par: Shao, Ninglu, et autres
Publié: (2024)
OUxInfo
par: Hatayama, Jun, et autres
Publié: (2026)
par: Hatayama, Jun, et autres
Publié: (2026)
OUxInfo
par: Hatayama, Jun, et autres
Publié: (2026)
par: Hatayama, Jun, et autres
Publié: (2026)
InfoMatch: Entropy Neural Estimation for Semi-Supervised Image Classification
par: Han, Qi, et autres
Publié: (2024)
par: Han, Qi, et autres
Publié: (2024)
Scaling up Multi-Turn Off-Policy RL and Multi-Agent Tree Search for LLM Step-Provers
par: Xin, Ran, et autres
Publié: (2025)
par: Xin, Ran, et autres
Publié: (2025)
Documents similaires
-
InfoFlow: A Framework for Multi-Layer Transformer Analysis
par: Yu, Penghao, et autres
Publié: (2026) -
InfoFlow KV: Information-Flow-Aware KV Recomputation for Long Context
par: Teng, Xin, et autres
Publié: (2026) -
Open Data Synthesis For Deep Research
par: Xia, Ziyi, et autres
Publié: (2025) -
Scent of Knowledge: Optimizing Search-Enhanced Reasoning with Information Foraging
par: Qian, Hongjin, et autres
Publié: (2025) -
BGE Landmark Embedding: A Chunking-Free Embedding Method For Retrieval Augmented Long-Context Large Language Models
par: Luo, Kun, et autres
Publié: (2024)