Saved in:
| Main Authors: | Yang, Ivy Yuqian, Zhang, David Yu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2511.14630 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Multi-step retrieval and reasoning improves radiology question answering with large language models
by: Wind, Sebastian, et al.
Published: (2025)
by: Wind, Sebastian, et al.
Published: (2025)
CaLMQA: Exploring culturally specific long-form question answering across 23 languages
by: Arora, Shane, et al.
Published: (2024)
by: Arora, Shane, et al.
Published: (2024)
Neural operators struggle to learn complex PDEs in pedestrian mobility: Hughes model case study
by: Chauhan, Prajwal, et al.
Published: (2025)
by: Chauhan, Prajwal, et al.
Published: (2025)
Policy alone is probably not the solution: A large-scale experiment on how developers struggle to design meaningful end-user explanations
by: Nahar, Nadia, et al.
Published: (2025)
by: Nahar, Nadia, et al.
Published: (2025)
How predictable is language model benchmark performance?
by: Owen, David
Published: (2024)
by: Owen, David
Published: (2024)
Large language models as uncertainty-calibrated optimizers for experimental discovery
by: Ranković, Bojana, et al.
Published: (2025)
by: Ranković, Bojana, et al.
Published: (2025)
Agentic retrieval-augmented reasoning reshapes collective reliability under model variability in radiology question answering
by: Farajiamiri, Mina, et al.
Published: (2026)
by: Farajiamiri, Mina, et al.
Published: (2026)
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes
by: Fu, Yuqian, et al.
Published: (2026)
by: Fu, Yuqian, et al.
Published: (2026)
Efficiency optimization of large-scale language models based on deep learning in natural language processing tasks
by: Mei, Taiyuan, et al.
Published: (2024)
by: Mei, Taiyuan, et al.
Published: (2024)
Agribot: agriculture-specific question answer system
by: Jain, Naman, et al.
Published: (2025)
by: Jain, Naman, et al.
Published: (2025)
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
by: Liu, Wenyuan, et al.
Published: (2025)
by: Liu, Wenyuan, et al.
Published: (2025)
Select to Perfect: Imitating desired behavior from large multi-agent data
by: Franzmeyer, Tim, et al.
Published: (2024)
by: Franzmeyer, Tim, et al.
Published: (2024)
Latent label distribution grid representation for modeling uncertainty
by: Sun, ShuNing, et al.
Published: (2025)
by: Sun, ShuNing, et al.
Published: (2025)
AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models
by: Zhang, Jiaming, et al.
Published: (2024)
by: Zhang, Jiaming, et al.
Published: (2024)
Large language models struggle with ethnographic text annotation
by: Goodall, Leonardo S., et al.
Published: (2026)
by: Goodall, Leonardo S., et al.
Published: (2026)
Deep Feature Embedding for Tabular Data
by: Wu, Yuqian, et al.
Published: (2024)
by: Wu, Yuqian, et al.
Published: (2024)
But what is your honest answer? Aiding LLM-judges with honest alternatives using steering vectors
by: Eshuijs, Leon, et al.
Published: (2025)
by: Eshuijs, Leon, et al.
Published: (2025)
Implicit meta-learning may lead language models to trust more reliable sources
by: Krasheninnikov, Dmitrii, et al.
Published: (2023)
by: Krasheninnikov, Dmitrii, et al.
Published: (2023)
Latent Space Data Fusion Outperforms Early Fusion in Multimodal Mental Health Digital Phenotyping Data
by: Barkat, Youcef, et al.
Published: (2025)
by: Barkat, Youcef, et al.
Published: (2025)
Context information can be more important than reasoning for time series forecasting with a large language model
by: Yang, Janghoon
Published: (2025)
by: Yang, Janghoon
Published: (2025)
Large language models can learn and generalize steganographic chain-of-thought under process supervision
by: Skaf, Joey, et al.
Published: (2025)
by: Skaf, Joey, et al.
Published: (2025)
Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis
by: Li, Hao, et al.
Published: (2026)
by: Li, Hao, et al.
Published: (2026)
The language of time: a language model perspective on time-series foundation models
by: Xie, Yi, et al.
Published: (2025)
by: Xie, Yi, et al.
Published: (2025)
Safety challenges of AI in medicine in the era of large language models
by: Wang, Xiaoye, et al.
Published: (2024)
by: Wang, Xiaoye, et al.
Published: (2024)
Quantifying construct validity in large language model evaluations
by: Kearns, Ryan Othniel
Published: (2026)
by: Kearns, Ryan Othniel
Published: (2026)
Applying sparse autoencoders to unlearn knowledge in language models
by: Farrell, Eoin, et al.
Published: (2024)
by: Farrell, Eoin, et al.
Published: (2024)
Text-guided multi-property molecular optimization with a diffusion language model
by: Xiong, Yida, et al.
Published: (2024)
by: Xiong, Yida, et al.
Published: (2024)
Alignment faking in large language models
by: Greenblatt, Ryan, et al.
Published: (2024)
by: Greenblatt, Ryan, et al.
Published: (2024)
Large Language Model Reasoning Failures
by: Song, Peiyang, et al.
Published: (2026)
by: Song, Peiyang, et al.
Published: (2026)
Can large language models explore in-context?
by: Krishnamurthy, Akshay, et al.
Published: (2024)
by: Krishnamurthy, Akshay, et al.
Published: (2024)
Representation in large language models
by: Yetman, Cameron
Published: (2025)
by: Yetman, Cameron
Published: (2025)
Long-form factuality in large language models
by: Wei, Jerry, et al.
Published: (2024)
by: Wei, Jerry, et al.
Published: (2024)
MergeIT: From Selection to Merging for Efficient Instruction Tuning
by: Cai, Hongyi, et al.
Published: (2025)
by: Cai, Hongyi, et al.
Published: (2025)
Improving training time and GPU utilization in geo-distributed language model training
by: Palak, et al.
Published: (2024)
by: Palak, et al.
Published: (2024)
Multimodal large language model for wheat breeding: a new exploration of smart breeding
by: Yang, Guofeng, et al.
Published: (2024)
by: Yang, Guofeng, et al.
Published: (2024)
Large language models can accurately predict searcher preferences
by: Thomas, Paul, et al.
Published: (2023)
by: Thomas, Paul, et al.
Published: (2023)
Replacing thinking with tool usage enables reasoning in small language models
by: Rainone, Corrado, et al.
Published: (2025)
by: Rainone, Corrado, et al.
Published: (2025)
Fresh in memory: Training-order recency is linearly encoded in language model activations
by: Krasheninnikov, Dmitrii, et al.
Published: (2025)
by: Krasheninnikov, Dmitrii, et al.
Published: (2025)
Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment
by: Yang, Zhiqin, et al.
Published: (2026)
by: Yang, Zhiqin, et al.
Published: (2026)
Auditing language models for hidden objectives
by: Marks, Samuel, et al.
Published: (2025)
by: Marks, Samuel, et al.
Published: (2025)
Similar Items
-
Multi-step retrieval and reasoning improves radiology question answering with large language models
by: Wind, Sebastian, et al.
Published: (2025) -
CaLMQA: Exploring culturally specific long-form question answering across 23 languages
by: Arora, Shane, et al.
Published: (2024) -
Neural operators struggle to learn complex PDEs in pedestrian mobility: Hughes model case study
by: Chauhan, Prajwal, et al.
Published: (2025) -
Policy alone is probably not the solution: A large-scale experiment on how developers struggle to design meaningful end-user explanations
by: Nahar, Nadia, et al.
Published: (2025) -
How predictable is language model benchmark performance?
by: Owen, David
Published: (2024)