Can Structural Cues Save LLMs? Evaluating Language Models in Massive Document Streams
Fuente:
arXiv
Guardado en:
| Autores principales: | Lee, Yukyung, Lim, Yebin, Jung, Woojun, Choi, Wonjun, Yoon, Susik |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-level Diagnosis and Evaluation for Robust Tabular Feature Engineering with Large Language Models
por: Lim, Yebin, et al.
Publicado: (2025)
por: Lim, Yebin, et al.
Publicado: (2025)
Segment-driven Structural Induction and Semantic Alignment for Heterogeneous Tabular Representation
por: Jung, Woojun, et al.
Publicado: (2026)
por: Jung, Woojun, et al.
Publicado: (2026)
CIRF: Tokenizing Chain-of-Thoughts into Reusable Functional Units for Efficient Latent Reasoning in Large Language Models
por: Lee, Yukyung, et al.
Publicado: (2026)
por: Lee, Yukyung, et al.
Publicado: (2026)
CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models
por: Lee, Sangin, et al.
Publicado: (2026)
por: Lee, Sangin, et al.
Publicado: (2026)
Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams
por: Kim, Jiyeon, et al.
Publicado: (2026)
por: Kim, Jiyeon, et al.
Publicado: (2026)
RExBench: Can coding agents autonomously implement AI research extensions?
por: Edwards, Nicholas, et al.
Publicado: (2025)
por: Edwards, Nicholas, et al.
Publicado: (2025)
Navigating the Path of Writing: Outline-guided Text Generation with Large Language Models
por: Lee, Yukyung, et al.
Publicado: (2024)
por: Lee, Yukyung, et al.
Publicado: (2024)
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
por: Lee, Wonjun, et al.
Publicado: (2025)
por: Lee, Wonjun, et al.
Publicado: (2025)
Can Video LLMs Refuse to Answer? Alignment for Answerability in Video Large Language Models
por: Yoon, Eunseop, et al.
Publicado: (2025)
por: Yoon, Eunseop, et al.
Publicado: (2025)
SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models
por: Jeong, Wonjun, et al.
Publicado: (2025)
por: Jeong, Wonjun, et al.
Publicado: (2025)
ProtoMed-LLM: An Automatic Evaluation Framework for Large Language Models in Medical Protocol Formulation
por: Yi, Seungjun, et al.
Publicado: (2024)
por: Yi, Seungjun, et al.
Publicado: (2024)
Can LLMs Recognize Toxicity? A Structured Investigation Framework and Toxicity Metric
por: Koh, Hyukhun, et al.
Publicado: (2024)
por: Koh, Hyukhun, et al.
Publicado: (2024)
FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model
por: Lee, Yebin, et al.
Publicado: (2024)
por: Lee, Yebin, et al.
Publicado: (2024)
Can Vision-Language Models Infer Speaker's Ignorance? The Role of Visual and Linguistic Cues
por: Cho, Ye-eun, et al.
Publicado: (2025)
por: Cho, Ye-eun, et al.
Publicado: (2025)
FLEX: A Benchmark for Evaluating Robustness of Fairness in Large Language Models
por: Jung, Dahyun, et al.
Publicado: (2025)
por: Jung, Dahyun, et al.
Publicado: (2025)
References Indeed Matter? Reference-Free Preference Optimization for Conversational Query Reformulation
por: Kim, Doyoung, et al.
Publicado: (2025)
por: Kim, Doyoung, et al.
Publicado: (2025)
StreamingThinker: Large Language Models Can Think While Reading
por: Tong, Junlong, et al.
Publicado: (2025)
por: Tong, Junlong, et al.
Publicado: (2025)
Chain-of-Thought Prompting Obscures Hallucination Cues in Large Language Models: An Empirical Evaluation
por: Cheng, Jiahao, et al.
Publicado: (2025)
por: Cheng, Jiahao, et al.
Publicado: (2025)
Bias in LLMs as Annotators: The Effect of Party Cues on Labelling Decision by Large Language Models
por: Vera, Sebastian Vallejo, et al.
Publicado: (2024)
por: Vera, Sebastian Vallejo, et al.
Publicado: (2024)
Can MLLMs Perform Text-to-Image In-Context Learning?
por: Zeng, Yuchen, et al.
Publicado: (2024)
por: Zeng, Yuchen, et al.
Publicado: (2024)
Saving the legacy of Hero Ibash: Evaluating Four Language Models for Aminoacian
por: Xiao, Yunze, et al.
Publicado: (2024)
por: Xiao, Yunze, et al.
Publicado: (2024)
HerO at AVeriTeC: The Herd of Open Large Language Models for Verifying Real-World Claims
por: Yoon, Yejun, et al.
Publicado: (2024)
por: Yoon, Yejun, et al.
Publicado: (2024)
Draft-based Approximate Inference for LLMs
por: Galim, Kevin, et al.
Publicado: (2025)
por: Galim, Kevin, et al.
Publicado: (2025)
BridG MT: Enhancing LLMs' Machine Translation Capabilities with Sentence Bridging and Gradual MT
por: Choi, Seung-Woo, et al.
Publicado: (2024)
por: Choi, Seung-Woo, et al.
Publicado: (2024)
Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs
por: Su, Guinan, et al.
Publicado: (2026)
por: Su, Guinan, et al.
Publicado: (2026)
Feasibility of Structuring Stress Documentation Using an Ontology-Guided Large Language Model
por: Kim, Hyeoneui, et al.
Publicado: (2025)
por: Kim, Hyeoneui, et al.
Publicado: (2025)
How Language Models Prioritize Contextual Grammatical Cues?
por: Amirzadeh, Hamidreza, et al.
Publicado: (2024)
por: Amirzadeh, Hamidreza, et al.
Publicado: (2024)
Probabilistic Vision-Language Representation for Weakly Supervised Temporal Action Localization
por: Lim, Geuntaek, et al.
Publicado: (2024)
por: Lim, Geuntaek, et al.
Publicado: (2024)
MELAC: Massive Evaluation of Large Language Models with Alignment of Culture in Persian Language
por: Farsi, Farhan, et al.
Publicado: (2025)
por: Farsi, Farhan, et al.
Publicado: (2025)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
por: Chern, Steffi, et al.
Publicado: (2024)
por: Chern, Steffi, et al.
Publicado: (2024)
Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs
por: Wang, Siyuan, et al.
Publicado: (2024)
por: Wang, Siyuan, et al.
Publicado: (2024)
HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models
por: Son, Guijin, et al.
Publicado: (2023)
por: Son, Guijin, et al.
Publicado: (2023)
Theme-Explanation Structure for Table Summarization using Large Language Models: A Case Study on Korean Tabular Data
por: Kwack, TaeYoon, et al.
Publicado: (2025)
por: Kwack, TaeYoon, et al.
Publicado: (2025)
Knowledge Integration Decay in Search-Augmented Reasoning of Large Language Models
por: Yu, Sangwon, et al.
Publicado: (2026)
por: Yu, Sangwon, et al.
Publicado: (2026)
Hypothetical Documents or Knowledge Leakage? Rethinking LLM-based Query Expansion
por: Yoon, Yejun, et al.
Publicado: (2025)
por: Yoon, Yejun, et al.
Publicado: (2025)
KMMLU: Measuring Massive Multitask Language Understanding in Korean
por: Son, Guijin, et al.
Publicado: (2024)
por: Son, Guijin, et al.
Publicado: (2024)
TextBandit: Evaluating Probabilistic Reasoning in LLMs Through Language-Only Decision Tasks
por: Lim, Jimin, et al.
Publicado: (2025)
por: Lim, Jimin, et al.
Publicado: (2025)
Can LLMs assist with Ambiguity? A Quantitative Evaluation of various Large Language Models on Word Sense Disambiguation
por: Sumanathilaka, T. G. D. K., et al.
Publicado: (2024)
por: Sumanathilaka, T. G. D. K., et al.
Publicado: (2024)
Enhancing Spoken Discourse Modeling in Language Models Using Gestural Cues
por: Suresh, Varsha, et al.
Publicado: (2025)
por: Suresh, Varsha, et al.
Publicado: (2025)
CLARIFID: Improving Radiology Report Generation by Reinforcing Clinically Accurate Impressions and Enforcing Detailed Findings
por: Lee, Kyeongkyu, et al.
Publicado: (2025)
por: Lee, Kyeongkyu, et al.
Publicado: (2025)
Ejemplares similares
-
Multi-level Diagnosis and Evaluation for Robust Tabular Feature Engineering with Large Language Models
por: Lim, Yebin, et al.
Publicado: (2025) -
Segment-driven Structural Induction and Semantic Alignment for Heterogeneous Tabular Representation
por: Jung, Woojun, et al.
Publicado: (2026) -
CIRF: Tokenizing Chain-of-Thoughts into Reusable Functional Units for Efficient Latent Reasoning in Large Language Models
por: Lee, Yukyung, et al.
Publicado: (2026) -
CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models
por: Lee, Sangin, et al.
Publicado: (2026) -
Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streams
por: Kim, Jiyeon, et al.
Publicado: (2026)