LitCab: Lightweight Language Model Calibration over Short- and Long-form Responses
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Xin, Khalifa, Muhammad, Wang, Lu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On Many-Shot In-Context Learning for Long-Context Evaluation
di: Zou, Kaijian, et al.
Pubblicazione: (2024)
di: Zou, Kaijian, et al.
Pubblicazione: (2024)
Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration
di: Liu, Xin, et al.
Pubblicazione: (2026)
di: Liu, Xin, et al.
Pubblicazione: (2026)
Calibrating Long-form Generations from Large Language Models
di: Huang, Yukun, et al.
Pubblicazione: (2024)
di: Huang, Yukun, et al.
Pubblicazione: (2024)
Enhancing Language Model Factuality via Activation-Based Confidence Calibration and Guided Decoding
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
Small Language Models Need Strong Verifiers to Self-Correct Reasoning
di: Zhang, Yunxiang, et al.
Pubblicazione: (2024)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2024)
A Survey of Large Language Models for Arabic Language and its Dialects
di: Mashaabi, Malak, et al.
Pubblicazione: (2024)
di: Mashaabi, Malak, et al.
Pubblicazione: (2024)
The Landscape of Arabic Large Language Models (ALLMs): A New Era for Arabic Language Technology
di: Al-Khalifa, Shahad, et al.
Pubblicazione: (2025)
di: Al-Khalifa, Shahad, et al.
Pubblicazione: (2025)
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)
Source-Aware Training Enables Knowledge Attribution in Language Models
di: Khalifa, Muhammad, et al.
Pubblicazione: (2024)
di: Khalifa, Muhammad, et al.
Pubblicazione: (2024)
LitVISTA: A Benchmark for Narrative Orchestration in Literary Text
di: Lu, Mingzhe, et al.
Pubblicazione: (2026)
di: Lu, Mingzhe, et al.
Pubblicazione: (2026)
LongPO: Long Context Self-Evolution of Large Language Models through Short-to-Long Preference Optimization
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
di: Chen, Guanzheng, et al.
Pubblicazione: (2025)
The Qiyas Benchmark: Measuring ChatGPT Mathematical and Language Understanding in Arabic
di: Al-Khalifa, Shahad, et al.
Pubblicazione: (2024)
di: Al-Khalifa, Shahad, et al.
Pubblicazione: (2024)
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
di: Huang, Hui, et al.
Pubblicazione: (2026)
di: Huang, Hui, et al.
Pubblicazione: (2026)
LitE-SQL: A Lightweight and Efficient Text-to-SQL Framework with Vector-based Schema Linking and Execution-Guided Self-Correction
di: Piao, Shengmin, et al.
Pubblicazione: (2025)
di: Piao, Shengmin, et al.
Pubblicazione: (2025)
Lightweight Audio Segmentation for Long-form Speech Translation
di: Lee, Jaesong, et al.
Pubblicazione: (2024)
di: Lee, Jaesong, et al.
Pubblicazione: (2024)
SEGMENT+: Long Text Processing with Short-Context Language Models
di: Shi, Wei, et al.
Pubblicazione: (2024)
di: Shi, Wei, et al.
Pubblicazione: (2024)
LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration Distillation
di: Dong, Zican, et al.
Pubblicazione: (2025)
di: Dong, Zican, et al.
Pubblicazione: (2025)
Can Language Models Laugh at YouTube Short-form Videos?
di: Ko, Dayoon, et al.
Pubblicazione: (2023)
di: Ko, Dayoon, et al.
Pubblicazione: (2023)
End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
di: Hu, Jiliang, et al.
Pubblicazione: (2025)
ShortGPT: Layers in Large Language Models are More Redundant Than You Expect
di: Men, Xin, et al.
Pubblicazione: (2024)
di: Men, Xin, et al.
Pubblicazione: (2024)
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
di: Khalifa, Muhammad, et al.
Pubblicazione: (2023)
di: Khalifa, Muhammad, et al.
Pubblicazione: (2023)
Self-Calibrated Listwise Reranking with Large Language Models
di: Ren, Ruiyang, et al.
Pubblicazione: (2024)
di: Ren, Ruiyang, et al.
Pubblicazione: (2024)
Long-Short Alignment for Effective Long-Context Modeling in LLMs
di: Du, Tianqi, et al.
Pubblicazione: (2025)
di: Du, Tianqi, et al.
Pubblicazione: (2025)
Credence Calibration Game? Calibrating Large Language Models through Structured Play
di: Fang, Ke, et al.
Pubblicazione: (2025)
di: Fang, Ke, et al.
Pubblicazione: (2025)
GEB-1.3B: Open Lightweight Large Language Model
di: Wu, Jie, et al.
Pubblicazione: (2024)
di: Wu, Jie, et al.
Pubblicazione: (2024)
Unlocking Efficient Long-to-Short LLM Reasoning with Model Merging
di: Wu, Han, et al.
Pubblicazione: (2025)
di: Wu, Han, et al.
Pubblicazione: (2025)
A Lightweight Large Language Model-Based Multi-Agent System for 2D Frame Structural Analysis
di: Geng, Ziheng, et al.
Pubblicazione: (2025)
di: Geng, Ziheng, et al.
Pubblicazione: (2025)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
AutoL2S: Auto Long-Short Reasoning for Efficient Large Language Models
di: Luo, Feng, et al.
Pubblicazione: (2025)
di: Luo, Feng, et al.
Pubblicazione: (2025)
LSTPrompt: Large Language Models as Zero-Shot Time Series Forecasters by Long-Short-Term Prompting
di: Liu, Haoxin, et al.
Pubblicazione: (2024)
di: Liu, Haoxin, et al.
Pubblicazione: (2024)
On Calibration of Large Language Models: From Response To Capability
di: Yang, Sin-Han, et al.
Pubblicazione: (2026)
di: Yang, Sin-Han, et al.
Pubblicazione: (2026)
FactCheckmate: Preemptively Detecting and Mitigating Hallucinations in LMs
di: Alnuhait, Deema, et al.
Pubblicazione: (2024)
di: Alnuhait, Deema, et al.
Pubblicazione: (2024)
Beyond Accuracy: The Role of Calibration in Self-Improving Large Language Models
di: Huang, Liangjie, et al.
Pubblicazione: (2025)
di: Huang, Liangjie, et al.
Pubblicazione: (2025)
From Code-Centric to Concept-Centric: Teaching NLP with LLM-Assisted "Vibe Coding"
di: Al-Khalifa, Hend
Pubblicazione: (2026)
di: Al-Khalifa, Hend
Pubblicazione: (2026)
Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
di: Khalifa, Muhammad, et al.
Pubblicazione: (2026)
Paths-over-Graph: Knowledge Graph Empowered Large Language Model Reasoning
di: Tan, Xingyu, et al.
Pubblicazione: (2024)
di: Tan, Xingyu, et al.
Pubblicazione: (2024)
MAS-LitEval : Multi-Agent System for Literary Translation Quality Assessment
di: Kim, Junghwan, et al.
Pubblicazione: (2025)
di: Kim, Junghwan, et al.
Pubblicazione: (2025)
SciLitLLM: How to Adapt LLMs for Scientific Literature Understanding
di: Li, Sihang, et al.
Pubblicazione: (2024)
di: Li, Sihang, et al.
Pubblicazione: (2024)
When Long Helps Short: How Context Length in Supervised Fine-tuning Affects Behavior of Large Language Models
di: Zheng, Yingming, et al.
Pubblicazione: (2025)
di: Zheng, Yingming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
On Many-Shot In-Context Learning for Long-Context Evaluation
di: Zou, Kaijian, et al.
Pubblicazione: (2024) -
Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration
di: Liu, Xin, et al.
Pubblicazione: (2026) -
Calibrating Long-form Generations from Large Language Models
di: Huang, Yukun, et al.
Pubblicazione: (2024) -
Enhancing Language Model Factuality via Activation-Based Confidence Calibration and Guided Decoding
di: Liu, Xin, et al.
Pubblicazione: (2024) -
Logit Arithmetic Elicits Long Reasoning Capabilities Without Training
di: Zhang, Yunxiang, et al.
Pubblicazione: (2025)