Agentic Uncertainty Quantification
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Jiaxin, Choubey, Prafulla Kumar, Huang, Kung-Hsiang, Xiong, Caiming, Wu, Chien-Sheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Benchmarking Deep Search over Heterogeneous Enterprise Data
di: Choubey, Prafulla Kumar, et al.
Pubblicazione: (2025)
di: Choubey, Prafulla Kumar, et al.
Pubblicazione: (2025)
Agentic Confidence Calibration
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
GTA: Generating Long-Horizon Tasks for Web Agents at Scale
di: Huang, Tenghao, et al.
Pubblicazione: (2026)
di: Huang, Tenghao, et al.
Pubblicazione: (2026)
SiReRAG: Indexing Similar and Related Information for Multihop Reasoning
di: Zhang, Nan, et al.
Pubblicazione: (2024)
di: Zhang, Nan, et al.
Pubblicazione: (2024)
Unanswerability Evaluation for Retrieval Augmented Generation
di: Peng, Xiangyu, et al.
Pubblicazione: (2024)
di: Peng, Xiangyu, et al.
Pubblicazione: (2024)
Embrace Divergence for Richer Insights: A Multi-document Summarization Benchmark and a Case Study on Summarizing Diverse Information from News Articles
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2023)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2023)
Do RAG Systems Cover What Matters? Evaluating and Optimizing Responses with Sub-Question Coverage
di: Xie, Kaige, et al.
Pubblicazione: (2024)
di: Xie, Kaige, et al.
Pubblicazione: (2024)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
CRMArena: Understanding the Capacity of LLM Agents to Perform Professional CRM Tasks in Realistic Environments
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2024)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2024)
Turning Conversations into Workflows: A Framework to Extract and Evaluate Dialog Workflows for Service AI Agents
di: Choubey, Prafulla Kumar, et al.
Pubblicazione: (2025)
di: Choubey, Prafulla Kumar, et al.
Pubblicazione: (2025)
Dont Stop Early: Scalable Enterprise Deep Research with Controlled Information Flow and Evidence-Aware Termination
di: Choubey, Prafulla Kumar, et al.
Pubblicazione: (2026)
di: Choubey, Prafulla Kumar, et al.
Pubblicazione: (2026)
Nudging the Boundaries of LLM Reasoning
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2025)
di: Chen, Justin Chih-Yao, et al.
Pubblicazione: (2025)
DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2025)
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2025)
From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026)
GUI-KV: Efficient GUI Agents via KV Cache with Spatio-Temporal Awareness
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025)
SPUQ: Perturbation-Based Uncertainty Quantification for Large Language Models
di: Gao, Xiang, et al.
Pubblicazione: (2024)
di: Gao, Xiang, et al.
Pubblicazione: (2024)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
LAM SIMULATOR: Advancing Data Generation for Large Action Model Training via Online Exploration and Trajectory Feedback
di: Hoang, Thai, et al.
Pubblicazione: (2025)
di: Hoang, Thai, et al.
Pubblicazione: (2025)
Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
Search Wisely: Mitigating Sub-optimal Agentic Searches By Reducing Uncertainty
di: Wu, Peilin, et al.
Pubblicazione: (2025)
di: Wu, Peilin, et al.
Pubblicazione: (2025)
SafeWorld: Geo-Diverse Safety Alignment
di: Yin, Da, et al.
Pubblicazione: (2024)
di: Yin, Da, et al.
Pubblicazione: (2024)
NewsEdits 2.0: Learning the Intentions Behind Updating News
di: Spangher, Alexander, et al.
Pubblicazione: (2024)
di: Spangher, Alexander, et al.
Pubblicazione: (2024)
MAQA: Evaluating Uncertainty Quantification in LLMs Regarding Data Uncertainty
di: Yang, Yongjin, et al.
Pubblicazione: (2024)
di: Yang, Yongjin, et al.
Pubblicazione: (2024)
Uncertainty Estimation of Large Language Models in Medical Question Answering
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
di: Wu, Jiaxin, et al.
Pubblicazione: (2024)
Parameter-Efficient Detoxification with Contrastive Decoding
di: Niu, Tong, et al.
Pubblicazione: (2024)
di: Niu, Tong, et al.
Pubblicazione: (2024)
Evolutionary Search for Automated Design of Uncertainty Quantification Methods
di: Seleznyov, Mikhail, et al.
Pubblicazione: (2026)
di: Seleznyov, Mikhail, et al.
Pubblicazione: (2026)
CSS: Contrastive Semantic Similarity for Uncertainty Quantification of LLMs
di: Ao, Shuang, et al.
Pubblicazione: (2024)
di: Ao, Shuang, et al.
Pubblicazione: (2024)
Multi-group Uncertainty Quantification for Long-form Text Generation
di: Liu, Terrance, et al.
Pubblicazione: (2024)
di: Liu, Terrance, et al.
Pubblicazione: (2024)
Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models
di: Zhou, Kevin, et al.
Pubblicazione: (2025)
di: Zhou, Kevin, et al.
Pubblicazione: (2025)
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
Uncertainty Quantification for Multimodal Large Language Models with Incoherence-adjusted Semantic Volume
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2026)
di: Lau, Gregory Kang Ruey, et al.
Pubblicazione: (2026)
Semantic Consistency-Based Uncertainty Quantification for Factuality in Radiology Report Generation
di: Wang, Chenyu, et al.
Pubblicazione: (2024)
di: Wang, Chenyu, et al.
Pubblicazione: (2024)
Uncertainty Quantification of Large Language Models through Multi-Dimensional Responses
di: Chen, Tiejin, et al.
Pubblicazione: (2025)
di: Chen, Tiejin, et al.
Pubblicazione: (2025)
Uncertainty Quantification in Large Language Models Through Convex Hull Analysis
di: Catak, Ferhat Ozgur, et al.
Pubblicazione: (2024)
di: Catak, Ferhat Ozgur, et al.
Pubblicazione: (2024)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
di: Pang, Bo, et al.
Pubblicazione: (2025)
di: Pang, Bo, et al.
Pubblicazione: (2025)
Trustworthy Summarization via Uncertainty Quantification and Risk Awareness in Large Language Models
di: Pan, Shuaidong, et al.
Pubblicazione: (2025)
di: Pan, Shuaidong, et al.
Pubblicazione: (2025)
Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory
di: Li, Weixian Waylon, et al.
Pubblicazione: (2026)
di: Li, Weixian Waylon, et al.
Pubblicazione: (2026)
Mind the Ambiguity: Aleatoric Uncertainty Quantification in LLMs for Safe Medical Question Answering
di: Liu, Yaokun, et al.
Pubblicazione: (2026)
di: Liu, Yaokun, et al.
Pubblicazione: (2026)
SIMBA UQ: Similarity-Based Aggregation for Uncertainty Quantification in Large Language Models
di: Bhattacharjya, Debarun, et al.
Pubblicazione: (2025)
di: Bhattacharjya, Debarun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Benchmarking Deep Search over Heterogeneous Enterprise Data
di: Choubey, Prafulla Kumar, et al.
Pubblicazione: (2025) -
Agentic Confidence Calibration
di: Zhang, Jiaxin, et al.
Pubblicazione: (2026) -
CRMArena-Pro: Holistic Assessment of LLM Agents Across Diverse Business Scenarios and Interactions
di: Huang, Kung-Hsiang, et al.
Pubblicazione: (2025) -
GTA: Generating Long-Horizon Tasks for Web Agents at Scale
di: Huang, Tenghao, et al.
Pubblicazione: (2026) -
SiReRAG: Indexing Similar and Related Information for Multihop Reasoning
di: Zhang, Nan, et al.
Pubblicazione: (2024)