Enregistré dans:
| Auteurs principaux: | Huang, Yukun, Ribeiro, Leonardo F. R., Hardalov, Momchil, Dhingra, Bhuwan, Dreyer, Markus, Saligrama, Venkatesh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.05912 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Real-time Factuality Assessment from Adversarial Feedback
par: Chen, Sanxing, et autres
Publié: (2024)
par: Chen, Sanxing, et autres
Publié: (2024)
Fuzzy Speculative Decoding for a Tunable Accuracy-Runtime Tradeoff
par: Holsman, Maximilian, et autres
Publié: (2025)
par: Holsman, Maximilian, et autres
Publié: (2025)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
Deep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research Agents
par: Chandrahasan, Prahaladh, et autres
Publié: (2025)
par: Chandrahasan, Prahaladh, et autres
Publié: (2025)
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
par: Huang, Yukun, et autres
Publié: (2025)
par: Huang, Yukun, et autres
Publié: (2025)
When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
par: Chen, Sanxing, et autres
Publié: (2025)
par: Chen, Sanxing, et autres
Publié: (2025)
Calibrating Long-form Generations from Large Language Models
par: Huang, Yukun, et autres
Publié: (2024)
par: Huang, Yukun, et autres
Publié: (2024)
Coding Agents are Effective Long-Context Processors
par: Cao, Weili, et autres
Publié: (2026)
par: Cao, Weili, et autres
Publié: (2026)
Adversarial Math Word Problem Generation
par: Xie, Roy, et autres
Publié: (2024)
par: Xie, Roy, et autres
Publié: (2024)
Detecting Check-Worthy Claims in Political Debates, Speeches, and Interviews Using Audio Data
par: Ivanov, Petar, et autres
Publié: (2023)
par: Ivanov, Petar, et autres
Publié: (2023)
SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data
par: Mishra, Samarth, et autres
Publié: (2025)
par: Mishra, Samarth, et autres
Publié: (2025)
Correct, Concise and Complete: Multi-stage Training For Adaptive Reasoning
par: Rakotonirina, Nathanaël Carraz, et autres
Publié: (2026)
par: Rakotonirina, Nathanaël Carraz, et autres
Publié: (2026)
Generalizability of Large Language Model-Based Agents: A Comprehensive Survey
par: Zhang, Minxing, et autres
Publié: (2025)
par: Zhang, Minxing, et autres
Publié: (2025)
Hierarchical Multi-Label Classification of Online Vaccine Concerns
par: Zhu, Chloe Qinyu, et autres
Publié: (2024)
par: Zhu, Chloe Qinyu, et autres
Publié: (2024)
How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning
par: Cai, Hongyi James, et autres
Publié: (2025)
par: Cai, Hongyi James, et autres
Publié: (2025)
Linear Transformers Implicitly Discover Unified Numerical Algorithms
par: Lutz, Patrick, et autres
Publié: (2025)
par: Lutz, Patrick, et autres
Publié: (2025)
Staircase Streaming for Low-Latency Multi-Agent Inference
par: Wang, Junlin, et autres
Publié: (2025)
par: Wang, Junlin, et autres
Publié: (2025)
Document-as-Image Representations Fall Short for Scientific Retrieval
par: Khalighinejad, Ghazal, et autres
Publié: (2026)
par: Khalighinejad, Ghazal, et autres
Publié: (2026)
VeriTrace: Evolving Mental Models for Deep Research Agents
par: Zhao, Haolang, et autres
Publié: (2026)
par: Zhao, Haolang, et autres
Publié: (2026)
IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations
par: Fu, Deqing, et autres
Publié: (2024)
par: Fu, Deqing, et autres
Publié: (2024)
Think Deep, Think Fast: Investigating Efficiency of Verifier-free Inference-time-scaling Methods
par: Wang, Junlin, et autres
Publié: (2025)
par: Wang, Junlin, et autres
Publié: (2025)
Atomic Self-Consistency for Better Long Form Generations
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)
Symmetry Reveals Layerwise Dynamics: How Transformers Perform In-Context Classification
par: Lutz, Patrick, et autres
Publié: (2026)
par: Lutz, Patrick, et autres
Publié: (2026)
RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models
par: Muhamed, Aashiq, et autres
Publié: (2025)
par: Muhamed, Aashiq, et autres
Publié: (2025)
DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent
par: Wu, Tongzhou, et autres
Publié: (2026)
par: Wu, Tongzhou, et autres
Publié: (2026)
DeepShop: A Benchmark for Deep Research Shopping Agents
par: Lyu, Yougang, et autres
Publié: (2025)
par: Lyu, Yougang, et autres
Publié: (2025)
Deep Companion Learning: Enhancing Generalization Through Historical Consistency
par: Zhu, Ruizhao, et autres
Publié: (2024)
par: Zhu, Ruizhao, et autres
Publié: (2024)
Factual Confidence of LLMs: on Reliability and Robustness of Current Estimators
par: Mahaut, Matéo, et autres
Publié: (2024)
par: Mahaut, Matéo, et autres
Publié: (2024)
FactAlign: Long-form Factuality Alignment of Large Language Models
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
BabyVLM: Data-Efficient Pretraining of VLMs Inspired by Infant Learning
par: Wang, Shengao, et autres
Publié: (2025)
par: Wang, Shengao, et autres
Publié: (2025)
Deep Researcher with Sequential Plan Reflection and Candidates Crossover (Deep Researcher Reflect Evolve)
par: Prateek, Saurav
Publié: (2026)
par: Prateek, Saurav
Publié: (2026)
SynCDR : Training Cross Domain Retrieval Models with Synthetic Data
par: Mishra, Samarth, et autres
Publié: (2023)
par: Mishra, Samarth, et autres
Publié: (2023)
InFact: Informativeness Alignment for Improved LLM Factuality
par: Cohen, Roi, et autres
Publié: (2025)
par: Cohen, Roi, et autres
Publié: (2025)
MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs
par: Ning, Yucheng, et autres
Publié: (2025)
par: Ning, Yucheng, et autres
Publié: (2025)
Over-Searching in Search-Augmented Large Language Models
par: Xie, Roy, et autres
Publié: (2026)
par: Xie, Roy, et autres
Publié: (2026)
EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents
par: Yuan, Zike, et autres
Publié: (2026)
par: Yuan, Zike, et autres
Publié: (2026)
Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification
par: Wan, Yuxuan, et autres
Publié: (2026)
par: Wan, Yuxuan, et autres
Publié: (2026)
Scientific Algorithm Discovery by Augmenting AlphaEvolve with Deep Research
par: Liu, Gang, et autres
Publié: (2025)
par: Liu, Gang, et autres
Publié: (2025)
LEAF: Learning and Evaluation Augmented by Fact-Checking to Improve Factualness in Large Language Models
par: Tran, Hieu, et autres
Publié: (2024)
par: Tran, Hieu, et autres
Publié: (2024)
Documents similaires
-
Real-time Factuality Assessment from Adversarial Feedback
par: Chen, Sanxing, et autres
Publié: (2024) -
Fuzzy Speculative Decoding for a Tunable Accuracy-Runtime Tradeoff
par: Holsman, Maximilian, et autres
Publié: (2025) -
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
par: Huang, Yukun, et autres
Publié: (2024) -
Deep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research Agents
par: Chandrahasan, Prahaladh, et autres
Publié: (2025) -
GenEOL: Harnessing the Generative Power of LLMs for Training-Free Sentence Embeddings
par: Thirukovalluru, Raghuveer, et autres
Publié: (2024)