ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking
Fuente:
arXiv
Salvato in:
| Autori principali: | Hu, Miaobo, Hu, Shuhao, Wang, BoKun, Sa, Yina, Wang, Xin, Guo, Xiaobo, Zha, Daren, Xiao, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
di: Hu, Miaobo, et al.
Pubblicazione: (2026)
SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization
di: Wang, Bo-Jyun, et al.
Pubblicazione: (2026)
di: Wang, Bo-Jyun, et al.
Pubblicazione: (2026)
Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
di: Guan, Xin, et al.
Pubblicazione: (2026)
di: Guan, Xin, et al.
Pubblicazione: (2026)
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)
di: Xiao, Teng, et al.
Pubblicazione: (2024)
Unsupervised Candidate Ranking for Lexical Substitution via Holistic Sentence Semantics
di: Hu, Zhongyang, et al.
Pubblicazione: (2025)
di: Hu, Zhongyang, et al.
Pubblicazione: (2025)
Pruning Large Language Models to Intra-module Low-rank Architecture with Transitional Activations
di: Shen, Bowen, et al.
Pubblicazione: (2024)
di: Shen, Bowen, et al.
Pubblicazione: (2024)
Disentangling Instructive Information from Ranked Multiple Candidates for Multi-Document Scientific Summarization
di: Wang, Pancheng, et al.
Pubblicazione: (2024)
di: Wang, Pancheng, et al.
Pubblicazione: (2024)
Integrating Unstructured Text into Causal Inference: Empirical Evidence from Real Data
di: Zhou, Boning, et al.
Pubblicazione: (2026)
di: Zhou, Boning, et al.
Pubblicazione: (2026)
HELP: HyperNode Expansion and Logical Path-Guided Evidence Localization for Accurate and Efficient GraphRAG
di: Huang, Yuqi, et al.
Pubblicazione: (2026)
di: Huang, Yuqi, et al.
Pubblicazione: (2026)
CluCERT: Certifying LLM Robustness via Clustering-Guided Denoising Smoothing
di: Wang, Zixia, et al.
Pubblicazione: (2025)
di: Wang, Zixia, et al.
Pubblicazione: (2025)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
Certified Signed Graph Unlearning
di: Zhao, Junpeng, et al.
Pubblicazione: (2025)
di: Zhao, Junpeng, et al.
Pubblicazione: (2025)
Certifiably Byzantine-Robust Federated Conformal Prediction
di: Kang, Mintong, et al.
Pubblicazione: (2024)
di: Kang, Mintong, et al.
Pubblicazione: (2024)
GOPO: Policy Optimization using Ranked Rewards
di: Choi, Kyuseong, et al.
Pubblicazione: (2026)
di: Choi, Kyuseong, et al.
Pubblicazione: (2026)
OptiSet: Unified Optimizing Set Selection and Ranking for Retrieval-Augmented Generation
di: Jiang, Yi, et al.
Pubblicazione: (2026)
di: Jiang, Yi, et al.
Pubblicazione: (2026)
Explainable AML Triage with LLMs: Evidence Retrieval and Counterfactual Checks
di: Torres, Dorothy, et al.
Pubblicazione: (2026)
di: Torres, Dorothy, et al.
Pubblicazione: (2026)
How Catastrophic is Your LLM? Certifying Risk in Conversation
di: Wang, Chengxiao, et al.
Pubblicazione: (2025)
di: Wang, Chengxiao, et al.
Pubblicazione: (2025)
Unlocking Interpretability for RF Sensing: A Complex-Valued White-Box Transformer
di: Zhang, Xie, et al.
Pubblicazione: (2025)
di: Zhang, Xie, et al.
Pubblicazione: (2025)
Certifying Counterfactual Bias in LLMs
di: Chaudhary, Isha, et al.
Pubblicazione: (2024)
di: Chaudhary, Isha, et al.
Pubblicazione: (2024)
Psychological Capital Questionnaire (PCQ-24): Preliminary Evidence of Psychometric Validity of the Brazilian Version
di: Daren Tashima Cid
Pubblicazione: (2020)
di: Daren Tashima Cid
Pubblicazione: (2020)
Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization
di: Luo, Yifu, et al.
Pubblicazione: (2025)
di: Luo, Yifu, et al.
Pubblicazione: (2025)
Pessimistic Off-Policy Optimization for Learning to Rank
di: Cief, Matej, et al.
Pubblicazione: (2022)
di: Cief, Matej, et al.
Pubblicazione: (2022)
GLIER: Generative Legal Inference and Evidence Ranking for Legal Case Retrieval
di: Li, Minghan, et al.
Pubblicazione: (2026)
di: Li, Minghan, et al.
Pubblicazione: (2026)
Difficulty-Estimated Policy Optimization
di: Zhao, Yu, et al.
Pubblicazione: (2026)
di: Zhao, Yu, et al.
Pubblicazione: (2026)
Matrix Low-Rank Trust Region Policy Optimization
di: Rozada, Sergio, et al.
Pubblicazione: (2024)
di: Rozada, Sergio, et al.
Pubblicazione: (2024)
Decision Flow Policy Optimization
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
Human-assisted Robotic Policy Refinement via Action Preference Optimization
di: Xia, Wenke, et al.
Pubblicazione: (2025)
di: Xia, Wenke, et al.
Pubblicazione: (2025)
EvidFuse: Writing-Time Evidence Learning for Consistent Text-Chart Data Reporting
di: Lin, Huanxiang, et al.
Pubblicazione: (2026)
di: Lin, Huanxiang, et al.
Pubblicazione: (2026)
State Regularized Policy Optimization on Data with Dynamics Shift
di: Xue, Zhenghai, et al.
Pubblicazione: (2023)
di: Xue, Zhenghai, et al.
Pubblicazione: (2023)
Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models
di: Lin, Moule, et al.
Pubblicazione: (2026)
di: Lin, Moule, et al.
Pubblicazione: (2026)
Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
di: Du, Yixuan, et al.
Pubblicazione: (2026)
di: Du, Yixuan, et al.
Pubblicazione: (2026)
A Basic Probability Assignment Generation Method Based on Normal Cloud Similarity and Its Application in Evidence Combination
di: Nuo Cheng, et al.
Pubblicazione: (2025)
di: Nuo Cheng, et al.
Pubblicazione: (2025)
AgenticRec: End-to-End Tool-Integrated Policy Optimization for Ranking-Oriented Recommender Agents
di: Li, Tianyi, et al.
Pubblicazione: (2026)
di: Li, Tianyi, et al.
Pubblicazione: (2026)
Preventing Rank Collapse in Federated Low-Rank Adaptation with Client Heterogeneity
di: Wu, Fei, et al.
Pubblicazione: (2026)
di: Wu, Fei, et al.
Pubblicazione: (2026)
Cer-Eval: Certifiable and Cost-Efficient Evaluation Framework for LLMs
di: Wang, Ganghua, et al.
Pubblicazione: (2025)
di: Wang, Ganghua, et al.
Pubblicazione: (2025)
Certifiably Robust Policies for Uncertain Parametric Environments
di: Schnitzer, Yannik, et al.
Pubblicazione: (2024)
di: Schnitzer, Yannik, et al.
Pubblicazione: (2024)
Unraveling the Spatial Heterogeneity of WEFE Nexus: The Vulnerable Ecological Hub and Policy Implications in the Yangtze River Delta
di: Yi'na Hu, et al.
Pubblicazione: (2026)
di: Yi'na Hu, et al.
Pubblicazione: (2026)
CROP: Conservative Reward for Model-based Offline Policy Optimization
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
StealthRank: LLM Ranking Manipulation via Stealthy Prompt Optimization
di: Tang, Yiming, et al.
Pubblicazione: (2025)
di: Tang, Yiming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback
di: Hu, Miaobo, et al.
Pubblicazione: (2026) -
SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction
di: Hu, Miaobo, et al.
Pubblicazione: (2026) -
SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization
di: Wang, Bo-Jyun, et al.
Pubblicazione: (2026) -
Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning
di: Guan, Xin, et al.
Pubblicazione: (2026) -
Towards Off-Policy Reinforcement Learning for Ranking Policies with Human Feedback
di: Xiao, Teng, et al.
Pubblicazione: (2024)