Guardado en:
| Autores principales: | Li, Shiyu, Tang, Yang, Wang, Yifan, Li, Peiming, Chen, Xi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2510.00568 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
SE-Search: Self-Evolving Search Agent via Memory and Dense Reward
por: Li, Jian, et al.
Publicado: (2026)
por: Li, Jian, et al.
Publicado: (2026)
Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
por: Tang, Yang, et al.
Publicado: (2025)
por: Tang, Yang, et al.
Publicado: (2025)
Instructive Dialogue Summarization with Query Aggregations
por: Wang, Bin, et al.
Publicado: (2023)
por: Wang, Bin, et al.
Publicado: (2023)
Conan-embedding: General Text Embedding with More and Better Negative Samples
por: Li, Shiyu, et al.
Publicado: (2024)
por: Li, Shiyu, et al.
Publicado: (2024)
ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search
por: Zhang, Dan, et al.
Publicado: (2024)
por: Zhang, Dan, et al.
Publicado: (2024)
Multi-Agent Consensus Seeking via Large Language Models
por: Chen, Huaben, et al.
Publicado: (2023)
por: Chen, Huaben, et al.
Publicado: (2023)
ExpSeek: Self-Triggered Experience Seeking for Web Agents
por: Zhang, Wenyuan, et al.
Publicado: (2026)
por: Zhang, Wenyuan, et al.
Publicado: (2026)
InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
por: Du, Yaxin, et al.
Publicado: (2025)
por: Du, Yaxin, et al.
Publicado: (2025)
WideSearch: Benchmarking Agentic Broad Info-Seeking
por: Wong, Ryan, et al.
Publicado: (2025)
por: Wong, Ryan, et al.
Publicado: (2025)
Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?
por: Zhao, Yibo, et al.
Publicado: (2026)
por: Zhao, Yibo, et al.
Publicado: (2026)
Unlocking Instructive In-Context Learning with Tabular Prompting for Relational Triple Extraction
por: Li, Guozheng, et al.
Publicado: (2024)
por: Li, Guozheng, et al.
Publicado: (2024)
Instructive Decoding: Instruction-Tuned Large Language Models are Self-Refiner from Noisy Instructions
por: Kim, Taehyeon, et al.
Publicado: (2023)
por: Kim, Taehyeon, et al.
Publicado: (2023)
Conan-Embedding-v2: Training an LLM from Scratch for Text Embeddings
por: Li, Shiyu, et al.
Publicado: (2025)
por: Li, Shiyu, et al.
Publicado: (2025)
SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generation
por: Hu, Minda, et al.
Publicado: (2024)
por: Hu, Minda, et al.
Publicado: (2024)
InfoAgent: Advancing Autonomous Information-Seeking Agents
por: Zhang, Gongrui, et al.
Publicado: (2025)
por: Zhang, Gongrui, et al.
Publicado: (2025)
EvolveSearch: An Iterative Self-Evolving Search Agent
por: Zhang, Dingchu, et al.
Publicado: (2025)
por: Zhang, Dingchu, et al.
Publicado: (2025)
RLVER: Reinforcement Learning with Verifiable Emotion Rewards for Empathetic Agents
por: Wang, Peisong, et al.
Publicado: (2025)
por: Wang, Peisong, et al.
Publicado: (2025)
ReFINE: A Reward-Based Framework for Interpretable and Nuanced Evaluation of Radiology Report Generation
por: Liu, Yunyi, et al.
Publicado: (2024)
por: Liu, Yunyi, et al.
Publicado: (2024)
Sparse Rewards Can Self-Train Dialogue Agents
por: Lattimer, Barrett Martin, et al.
Publicado: (2024)
por: Lattimer, Barrett Martin, et al.
Publicado: (2024)
Triviality Corrected Endogenous Reward
por: Wang, Xinda, et al.
Publicado: (2026)
por: Wang, Xinda, et al.
Publicado: (2026)
Re-ReST: Reflection-Reinforced Self-Training for Language Agents
por: Dou, Zi-Yi, et al.
Publicado: (2024)
por: Dou, Zi-Yi, et al.
Publicado: (2024)
AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents
por: Gao, Wenbo, et al.
Publicado: (2026)
por: Gao, Wenbo, et al.
Publicado: (2026)
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
por: Wu, Juncheng, et al.
Publicado: (2026)
por: Wu, Juncheng, et al.
Publicado: (2026)
SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents
por: Cai, Shaofei, et al.
Publicado: (2025)
por: Cai, Shaofei, et al.
Publicado: (2025)
Beyond Retrieval-Ranking: A Multi-Agent Cognitive Decision Framework for E-Commerce Search
por: Zhai, Zhouwei, et al.
Publicado: (2025)
por: Zhai, Zhouwei, et al.
Publicado: (2025)
ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding
por: Sun, Zhongxiang, et al.
Publicado: (2025)
por: Sun, Zhongxiang, et al.
Publicado: (2025)
Think&Cite: Improving Attributed Text Generation with Self-Guided Tree Search and Progress Reward Modeling
por: Li, Junyi, et al.
Publicado: (2024)
por: Li, Junyi, et al.
Publicado: (2024)
Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards
por: Zhang, Jiajie, et al.
Publicado: (2026)
por: Zhang, Jiajie, et al.
Publicado: (2026)
A Comprehensive Graph Framework for Question Answering with Mode-Seeking Preference Alignment
por: Tang, Quanwei, et al.
Publicado: (2025)
por: Tang, Quanwei, et al.
Publicado: (2025)
Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios
por: Zang, Jianxiang, et al.
Publicado: (2025)
por: Zang, Jianxiang, et al.
Publicado: (2025)
The Flip Side of RLHF: On-Policy Feedback for Reward Model Self-Supervised Improvement
por: Wang, Xiaobo, et al.
Publicado: (2026)
por: Wang, Xiaobo, et al.
Publicado: (2026)
ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning
por: Chen, Mingyang, et al.
Publicado: (2025)
por: Chen, Mingyang, et al.
Publicado: (2025)
Aligning Deep Implicit Preferences by Learning to Reason Defensively
por: Li, Peiming, et al.
Publicado: (2025)
por: Li, Peiming, et al.
Publicado: (2025)
Self-Correction Makes LLMs Better Parsers
por: Zhang, Ziyan, et al.
Publicado: (2025)
por: Zhang, Ziyan, et al.
Publicado: (2025)
Contrastive Learning on LLM Back Generation Treebank for Cross-domain Constituency Parsing
por: Guo, Peiming, et al.
Publicado: (2025)
por: Guo, Peiming, et al.
Publicado: (2025)
DeepWideSearch: Benchmarking Depth and Width in Agentic Information Seeking
por: Lan, Tian, et al.
Publicado: (2025)
por: Lan, Tian, et al.
Publicado: (2025)
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
por: Lu, Songshuo, et al.
Publicado: (2025)
por: Lu, Songshuo, et al.
Publicado: (2025)
VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
ARIA: Training Language Agents with Intention-Driven Reward Aggregation
por: Yang, Ruihan, et al.
Publicado: (2025)
por: Yang, Ruihan, et al.
Publicado: (2025)
Ejemplares similares
-
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026) -
SE-Search: Self-Evolving Search Agent via Memory and Dense Reward
por: Li, Jian, et al.
Publicado: (2026) -
Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
por: Tang, Yang, et al.
Publicado: (2025) -
Instructive Dialogue Summarization with Query Aggregations
por: Wang, Bin, et al.
Publicado: (2023) -
Conan-embedding: General Text Embedding with More and Better Negative Samples
por: Li, Shiyu, et al.
Publicado: (2024)