Salvato in:
| Autori principali: | Tiblias, Federico, Bigoulaeva, Irina, Niu, Jingcheng, Balloccu, Simone, Gurevych, Iryna |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2510.01025 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
The Inherent Limits of Pretrained LLMs: The Unexpected Convergence of Instruction Tuning and In-Context Learning Capabilities
di: Bigoulaeva, Irina, et al.
Pubblicazione: (2025)
di: Bigoulaeva, Irina, et al.
Pubblicazione: (2025)
Illusion or Algorithm? Investigating Memorization, Emergence, and Symbolic Processing in In-Context Learning
di: Niu, Jingcheng, et al.
Pubblicazione: (2025)
di: Niu, Jingcheng, et al.
Pubblicazione: (2025)
Patches of Nonlinearity: Instruction Vectors in Large Language Models
di: Bigoulaeva, Irina, et al.
Pubblicazione: (2026)
di: Bigoulaeva, Irina, et al.
Pubblicazione: (2026)
MAGneT: Coordinated Multi-Agent Generation of Synthetic Multi-Turn Mental Health Counseling Sessions
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
Leak, Cheat, Repeat: Data Contamination and Evaluation Malpractices in Closed-Source LLMs
di: Balloccu, Simone, et al.
Pubblicazione: (2024)
di: Balloccu, Simone, et al.
Pubblicazione: (2024)
SciCoQA: Quality Assurance for Scientific Paper--Code Alignment
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2026)
Factual Self-Awareness in Language Models: Representation, Robustness, and Scaling
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
di: Tamoyan, Hovhannes, et al.
Pubblicazione: (2025)
Are Emergent Abilities in Large Language Models just In-Context Learning?
di: Lu, Sheng, et al.
Pubblicazione: (2023)
di: Lu, Sheng, et al.
Pubblicazione: (2023)
SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2025)
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2025)
IRCoder: Intermediate Representations Make Language Models Robust Multilingual Code Generators
di: Paul, Indraneil, et al.
Pubblicazione: (2024)
di: Paul, Indraneil, et al.
Pubblicazione: (2024)
Preemptive Detection and Correction of Misaligned Actions in LLM Agents
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
di: Fang, Haishuo, et al.
Pubblicazione: (2024)
Towards Privacy-aware Mental Health AI Models: Advances, Challenges, and Opportunities
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
PeerQA: A Scientific Question Answering Dataset from Peer Reviews
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025)
di: Baumgärtner, Tim, et al.
Pubblicazione: (2025)
Multimodal Large Language Models to Support Real-World Fact-Checking
di: Geng, Jiahui, et al.
Pubblicazione: (2024)
di: Geng, Jiahui, et al.
Pubblicazione: (2024)
Sensitivity, Performance, Robustness: Deconstructing the Effect of Sociodemographic Prompting
di: Beck, Tilman, et al.
Pubblicazione: (2023)
di: Beck, Tilman, et al.
Pubblicazione: (2023)
From Problem-Solving to Teaching Problem-Solving: Aligning LLMs with Pedagogy using Reinforcement Learning
di: Dinucu-Jianu, David, et al.
Pubblicazione: (2025)
di: Dinucu-Jianu, David, et al.
Pubblicazione: (2025)
The Good, the Bad and the Constructive: Automatically Measuring Peer Review's Utility for Authors
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2025)
di: Sadallah, Abdelrahman, et al.
Pubblicazione: (2025)
DOCE: Finding the Sweet Spot for Execution-Based Code Generation
di: Li, Haau-Sing, et al.
Pubblicazione: (2024)
di: Li, Haau-Sing, et al.
Pubblicazione: (2024)
SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)
di: Rizvi, Md Imbesat Hassan, et al.
Pubblicazione: (2024)
Uncertainty-Aware Decoding with Minimum Bayes Risk
di: Daheim, Nico, et al.
Pubblicazione: (2025)
di: Daheim, Nico, et al.
Pubblicazione: (2025)
CORE-T: COherent REtrieval of Tables for Text-to-SQL
di: Soliman, Hassan, et al.
Pubblicazione: (2026)
di: Soliman, Hassan, et al.
Pubblicazione: (2026)
From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves
di: Puerto, Haritz, et al.
Pubblicazione: (2026)
di: Puerto, Haritz, et al.
Pubblicazione: (2026)
Towards Automated Error Discovery: A Study in Conversational AI
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
di: Petrak, Dominic, et al.
Pubblicazione: (2025)
A Comprehensive Review of Datasets for Clinical Mental Health AI Systems
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
di: Mandal, Aishik, et al.
Pubblicazione: (2025)
Can LLMs Automate Fact-Checking Article Writing?
di: Sahnan, Dhruv, et al.
Pubblicazione: (2025)
di: Sahnan, Dhruv, et al.
Pubblicazione: (2025)
OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs
di: Iqbal, Hasan, et al.
Pubblicazione: (2024)
di: Iqbal, Hasan, et al.
Pubblicazione: (2024)
A Survey of Confidence Estimation and Calibration in Large Language Models
di: Geng, Jiahui, et al.
Pubblicazione: (2023)
di: Geng, Jiahui, et al.
Pubblicazione: (2023)
Stepwise Verification and Remediation of Student Reasoning Errors with Large Language Model Tutors
di: Daheim, Nico, et al.
Pubblicazione: (2024)
di: Daheim, Nico, et al.
Pubblicazione: (2024)
ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation Grounding
di: Paul, Indraneil, et al.
Pubblicazione: (2025)
di: Paul, Indraneil, et al.
Pubblicazione: (2025)
RIRAG: Regulatory Information Retrieval and Answer Generation
di: Gokhan, Tuba, et al.
Pubblicazione: (2024)
di: Gokhan, Tuba, et al.
Pubblicazione: (2024)
MathTutorBench: A Benchmark for Measuring Open-ended Pedagogical Capabilities of LLM Tutors
di: Macina, Jakub, et al.
Pubblicazione: (2025)
di: Macina, Jakub, et al.
Pubblicazione: (2025)
Model Merging by Uncertainty-Based Gradient Matching
di: Daheim, Nico, et al.
Pubblicazione: (2023)
di: Daheim, Nico, et al.
Pubblicazione: (2023)
Subjective Code Preferences in Experts and Large Language Models
di: Mokhova, Anna, et al.
Pubblicazione: (2026)
di: Mokhova, Anna, et al.
Pubblicazione: (2026)
When LLMs Can't Help: Real-World Evaluation of LLMs in Nutrition
di: Li, Karen Jia-Hui, et al.
Pubblicazione: (2025)
di: Li, Karen Jia-Hui, et al.
Pubblicazione: (2025)
Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs
di: Jin, Mingyu, et al.
Pubblicazione: (2026)
di: Jin, Mingyu, et al.
Pubblicazione: (2026)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
di: Li, Shilong, et al.
Pubblicazione: (2024)
di: Li, Shilong, et al.
Pubblicazione: (2024)
Abstain-R1: Calibrated Abstention and Post-Refusal Clarification via Verifiable RL
di: Zhai, Skylar, et al.
Pubblicazione: (2026)
di: Zhai, Skylar, et al.
Pubblicazione: (2026)
Pruning via Merging: Compressing LLMs via Manifold Alignment Based Layer Merging
di: Liu, Deyuan, et al.
Pubblicazione: (2024)
di: Liu, Deyuan, et al.
Pubblicazione: (2024)
Hypothesis-Driven Theory-of-Mind Reasoning for Large Language Models
di: Kim, Hyunwoo, et al.
Pubblicazione: (2025)
di: Kim, Hyunwoo, et al.
Pubblicazione: (2025)
Citation Failure: Definition, Analysis and Efficient Mitigation
di: Buchmann, Jan, et al.
Pubblicazione: (2025)
di: Buchmann, Jan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
The Inherent Limits of Pretrained LLMs: The Unexpected Convergence of Instruction Tuning and In-Context Learning Capabilities
di: Bigoulaeva, Irina, et al.
Pubblicazione: (2025) -
Illusion or Algorithm? Investigating Memorization, Emergence, and Symbolic Processing in In-Context Learning
di: Niu, Jingcheng, et al.
Pubblicazione: (2025) -
Patches of Nonlinearity: Instruction Vectors in Large Language Models
di: Bigoulaeva, Irina, et al.
Pubblicazione: (2026) -
MAGneT: Coordinated Multi-Agent Generation of Synthetic Multi-Turn Mental Health Counseling Sessions
di: Mandal, Aishik, et al.
Pubblicazione: (2025) -
Leak, Cheat, Repeat: Data Contamination and Evaluation Malpractices in Closed-Source LLMs
di: Balloccu, Simone, et al.
Pubblicazione: (2024)