A Survey of Calibration Process for Black-Box LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Xie, Liangru, Liu, Hui, Zeng, Jingying, Tang, Xianfeng, Han, Yan, Luo, Chen, Huang, Jing, Li, Zhen, Wang, Suhang, He, Qi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
Cite Before You Speak: Enhancing Context-Response Grounding in E-commerce Conversational LLM-Agents
di: Zeng, Jingying, et al.
Pubblicazione: (2025)
di: Zeng, Jingying, et al.
Pubblicazione: (2025)
A General Framework to Enhance Fine-tuning-based LLM Unlearning
di: Ren, Jie, et al.
Pubblicazione: (2025)
di: Ren, Jie, et al.
Pubblicazione: (2025)
AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
di: Wang, Fali, et al.
Pubblicazione: (2025)
di: Wang, Fali, et al.
Pubblicazione: (2025)
Examples as the Prompt: A Scalable Approach for Efficient LLM Adaptation in E-Commerce
di: Zeng, Jingying, et al.
Pubblicazione: (2025)
di: Zeng, Jingying, et al.
Pubblicazione: (2025)
Bradley-Terry and Multi-Objective Reward Modeling Are Complementary
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
Adaptive Test-Time Reasoning via Reward-Guided Dual-Phase Search
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
di: Cui, Yingqian, et al.
Pubblicazione: (2025)
Reasoning with Graphs: Structuring Implicit Knowledge to Enhance LLMs Reasoning
di: Han, Haoyu, et al.
Pubblicazione: (2025)
di: Han, Haoyu, et al.
Pubblicazione: (2025)
A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications
di: Lin, Minhua, et al.
Pubblicazione: (2025)
di: Lin, Minhua, et al.
Pubblicazione: (2025)
How Far are LLMs from Real Search? A Comprehensive Study on Efficiency, Completeness, and Inherent Capabilities
di: Lin, Minhua, et al.
Pubblicazione: (2025)
di: Lin, Minhua, et al.
Pubblicazione: (2025)
Catastrophic Failure of LLM Unlearning via Quantization
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2024)
ViLBench: A Suite for Vision-Language Process Reward Modeling
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
di: Tu, Haoqin, et al.
Pubblicazione: (2025)
Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models
di: Gan, Zeyu, et al.
Pubblicazione: (2026)
di: Gan, Zeyu, et al.
Pubblicazione: (2026)
CrossTune: Black-Box Few-Shot Classification with Label Enhancement
di: Luo, Danqing, et al.
Pubblicazione: (2024)
di: Luo, Danqing, et al.
Pubblicazione: (2024)
Group Fairness Meets the Black Box: Enabling Fair Algorithms on Closed LLMs via Post-Processing
di: Xian, Ruicheng, et al.
Pubblicazione: (2025)
di: Xian, Ruicheng, et al.
Pubblicazione: (2025)
Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph
di: Wang, Fali, et al.
Pubblicazione: (2025)
di: Wang, Fali, et al.
Pubblicazione: (2025)
How Far Are LLMs from Professional Poker Players? Revisiting Game-Theoretic Reasoning with Agentic Tool Use
di: Lin, Minhua, et al.
Pubblicazione: (2026)
di: Lin, Minhua, et al.
Pubblicazione: (2026)
Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
di: Zhang, Zhiwei, et al.
Pubblicazione: (2025)
Divide-Verify-Refine: Can LLMs Self-Align with Complex Instructions?
di: Zhang, Xianren, et al.
Pubblicazione: (2024)
di: Zhang, Xianren, et al.
Pubblicazione: (2024)
Harnessing the Unseen: The Hidden Influence of Intrinsic Knowledge in Long-Context Language Models
di: Fu, Yu, et al.
Pubblicazione: (2025)
di: Fu, Yu, et al.
Pubblicazione: (2025)
A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness
di: Wang, Fali, et al.
Pubblicazione: (2024)
di: Wang, Fali, et al.
Pubblicazione: (2024)
Consistency Matters: Explore LLMs Consistency From a Black-Box Perspective
di: Zhao, Fufangchen, et al.
Pubblicazione: (2024)
di: Zhao, Fufangchen, et al.
Pubblicazione: (2024)
A Theoretical Understanding of Chain-of-Thought: Coherent Reasoning and Error-Aware Demonstration
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
di: Cui, Yingqian, et al.
Pubblicazione: (2024)
FlexLLM: Exploring LLM Customization for Moving Target Defense on Black-Box LLMs Against Jailbreak Attacks
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
di: Chen, Bocheng, et al.
Pubblicazione: (2024)
Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
di: Zhang, Chiyu, et al.
Pubblicazione: (2025)
Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey
di: Liu, Xiaoou, et al.
Pubblicazione: (2025)
di: Liu, Xiaoou, et al.
Pubblicazione: (2025)
Matryoshka Pilot: Learning to Drive Black-Box LLMs with LLMs
di: Li, Changhao, et al.
Pubblicazione: (2024)
di: Li, Changhao, et al.
Pubblicazione: (2024)
BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs
di: Ghaddar, Abbas, et al.
Pubblicazione: (2026)
di: Ghaddar, Abbas, et al.
Pubblicazione: (2026)
Beyond Black-Box Interventions: Latent Probing for Faithful Retrieval-Augmented Generation
di: Gao, Linfeng, et al.
Pubblicazione: (2025)
di: Gao, Linfeng, et al.
Pubblicazione: (2025)
Knowledge Distillation of Black-Box Large Language Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
di: Chen, Hongzhan, et al.
Pubblicazione: (2024)
m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Models
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
di: Huang, Xiaoke, et al.
Pubblicazione: (2025)
Black-Box Prompt Optimization: Aligning Large Language Models without Model Training
di: Cheng, Jiale, et al.
Pubblicazione: (2023)
di: Cheng, Jiale, et al.
Pubblicazione: (2023)
Evaluating the Effectiveness of Black-Box Prompt Optimization as the Scale of LLMs Continues to Grow
di: Zhou, Ziyu, et al.
Pubblicazione: (2025)
di: Zhou, Ziyu, et al.
Pubblicazione: (2025)
To trust or not to trust: Attention-based Trust Management for LLM Multi-Agent Systems
di: He, Pengfei, et al.
Pubblicazione: (2025)
di: He, Pengfei, et al.
Pubblicazione: (2025)
WEBSERV: A Full-Stack and RL-Ready Web Environment for Training Web Agents at Scale
di: Lu, Yuxuan, et al.
Pubblicazione: (2025)
di: Lu, Yuxuan, et al.
Pubblicazione: (2025)
Tree of Attacks: Jailbreaking Black-Box LLMs Automatically
di: Mehrotra, Anay, et al.
Pubblicazione: (2023)
di: Mehrotra, Anay, et al.
Pubblicazione: (2023)
Bias Testing and Mitigation in Black Box LLMs using Metamorphic Relations
di: Salimian, Sina, et al.
Pubblicazione: (2025)
di: Salimian, Sina, et al.
Pubblicazione: (2025)
PCS: Perceived Confidence Scoring of Black Box LLMs with Metamorphic Relations
di: Salimian, Sina, et al.
Pubblicazione: (2025)
di: Salimian, Sina, et al.
Pubblicazione: (2025)
SafePassage: High-Fidelity Information Extraction with Black Box LLMs
di: Barrow, Joe, et al.
Pubblicazione: (2025)
di: Barrow, Joe, et al.
Pubblicazione: (2025)
Graph of Attacks: Improved Black-Box and Interpretable Jailbreaks for LLMs
di: Akbar-Tajari, Mohammad, et al.
Pubblicazione: (2025)
di: Akbar-Tajari, Mohammad, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
di: Cui, Yingqian, et al.
Pubblicazione: (2025) -
Cite Before You Speak: Enhancing Context-Response Grounding in E-commerce Conversational LLM-Agents
di: Zeng, Jingying, et al.
Pubblicazione: (2025) -
A General Framework to Enhance Fine-tuning-based LLM Unlearning
di: Ren, Jie, et al.
Pubblicazione: (2025) -
AgentTTS: Large Language Model Agent for Test-time Compute-optimal Scaling Strategy in Complex Tasks
di: Wang, Fali, et al.
Pubblicazione: (2025) -
Examples as the Prompt: A Scalable Approach for Efficient LLM Adaptation in E-Commerce
di: Zeng, Jingying, et al.
Pubblicazione: (2025)