Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Li, Hongmin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FastUMAP: Scalable Dimensionality Reduction via Bipartite Landmark Sampling
par: Li, Hongmin
Publié: (2026)
par: Li, Hongmin
Publié: (2026)
A Controlled Counterexample to Strong Proxy-Based Explanations of OOD Performance: in a Fixed Pretraining-and-Probing Setup
par: Li, Hongmin
Publié: (2026)
par: Li, Hongmin
Publié: (2026)
Separating Shortcut Transition from Cross-Family OOD Failure in a Minimal Model
par: Li, Hongmin
Publié: (2026)
par: Li, Hongmin
Publié: (2026)
ISAAC: Auditing Causal Reasoning in Deep Models for Drug-Target Interaction
par: Tarantino, Barbara, et autres
Publié: (2026)
par: Tarantino, Barbara, et autres
Publié: (2026)
Automated Network Protocol Testing with LLM Agents
par: Wei, Yunze, et autres
Publié: (2025)
par: Wei, Yunze, et autres
Publié: (2025)
Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization
par: Zhai, Zhiyuan, et autres
Publié: (2026)
par: Zhai, Zhiyuan, et autres
Publié: (2026)
Predictive Auditing of Hidden Tokens in LLM APIs via Reasoning Length Estimation
par: Wang, Ziyao, et autres
Publié: (2025)
par: Wang, Ziyao, et autres
Publié: (2025)
A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving
par: Kadadekar, Sahil
Publié: (2026)
par: Kadadekar, Sahil
Publié: (2026)
$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space
par: Wang, Peihao, et autres
Publié: (2026)
par: Wang, Peihao, et autres
Publié: (2026)
BAR Conjecture: the Feasibility of Inference Budget-Constrained LLM Services with Authenticity and Reasoning
par: Zhou, Jinan, et autres
Publié: (2025)
par: Zhou, Jinan, et autres
Publié: (2025)
Vital Trace: Protocol-Constrained Patient-State Reasoning for Longitudinal Clinical Trajectories
par: Qu, Zhan, et autres
Publié: (2026)
par: Qu, Zhan, et autres
Publié: (2026)
An Auditing Test To Detect Behavioral Shift in Language Models
par: Richter, Leo, et autres
Publié: (2024)
par: Richter, Leo, et autres
Publié: (2024)
PromptAudit: Auditing Prompt Sensitivity in LLM-Based Vulnerability Detection
par: Camarato, Steffen J., et autres
Publié: (2026)
par: Camarato, Steffen J., et autres
Publié: (2026)
Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning
par: Wang, Peihao, et autres
Publié: (2026)
par: Wang, Peihao, et autres
Publié: (2026)
Stress-Testing Alignment Audits With Prompt-Level Strategic Deception
par: Daniels, Oliver, et autres
Publié: (2026)
par: Daniels, Oliver, et autres
Publié: (2026)
FastTTS: Accelerating Test-Time Scaling for Edge LLM Reasoning
par: Chen, Hao Mark, et autres
Publié: (2025)
par: Chen, Hao Mark, et autres
Publié: (2025)
LSEC: Large-scale spectral ensemble clustering
par: Li, Hongmin, et autres
Publié: (2021)
par: Li, Hongmin, et autres
Publié: (2021)
Who Gets Which Message? Auditing Demographic Bias in LLM-Generated Targeted Text
par: Islam, Tunazzina
Publié: (2026)
par: Islam, Tunazzina
Publié: (2026)
Auditing Reasoning-Trace Memorization Claims after Unlearning with Head-Conditioned Canaries
par: Li, Yanhang, et autres
Publié: (2026)
par: Li, Yanhang, et autres
Publié: (2026)
Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models
par: Sathyanarayanan, Anish, et autres
Publié: (2026)
par: Sathyanarayanan, Anish, et autres
Publié: (2026)
Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores
par: Panda, Shevya, et autres
Publié: (2026)
par: Panda, Shevya, et autres
Publié: (2026)
COMPASS: Benchmarking Constrained Optimization in LLM Agents
par: Qin, Tian, et autres
Publié: (2025)
par: Qin, Tian, et autres
Publié: (2025)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
par: Patel, Bhrij, et autres
Publié: (2024)
par: Patel, Bhrij, et autres
Publié: (2024)
Efficient LLM Jailbreak via Adaptive Dense-to-sparse Constrained Optimization
par: Hu, Kai, et autres
Publié: (2024)
par: Hu, Kai, et autres
Publié: (2024)
Auditing Information Disclosure During LLM-Scale Gradient Descent Using Gradient Uniqueness
par: Abdelghafar, Sleem, et autres
Publié: (2025)
par: Abdelghafar, Sleem, et autres
Publié: (2025)
TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
par: Li, Jiaqian, et autres
Publié: (2026)
par: Li, Jiaqian, et autres
Publié: (2026)
MCP Safety Audit: LLMs with the Model Context Protocol Allow Major Security Exploits
par: Radosevich, Brandon, et autres
Publié: (2025)
par: Radosevich, Brandon, et autres
Publié: (2025)
Guided Reasoning in LLM-Driven Penetration Testing Using Structured Attack Trees
par: Nakano, Katsuaki, et autres
Publié: (2025)
par: Nakano, Katsuaki, et autres
Publié: (2025)
Do Multilingual VLMs Reason Equally? A Cross-Lingual Visual Reasoning Audit for Indian Languages
par: R, Swastik
Publié: (2026)
par: R, Swastik
Publié: (2026)
Can LLM Safety Be Ensured by Constraining Parameter Regions?
par: Li, Zongmin, et autres
Publié: (2026)
par: Li, Zongmin, et autres
Publié: (2026)
DASH: Deterministic Attention Scheduling for High-throughput Reproducible LLM Training
par: Qiang, Xinwei, et autres
Publié: (2026)
par: Qiang, Xinwei, et autres
Publié: (2026)
CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection
par: Song, Yiliang, et autres
Publié: (2026)
par: Song, Yiliang, et autres
Publié: (2026)
Constrained Meta Reinforcement Learning with Provable Test-Time Safety
par: Ni, Tingting, et autres
Publié: (2026)
par: Ni, Tingting, et autres
Publié: (2026)
LACONIC: Length-Aware Constrained Reinforcement Learning for LLM
par: Liu, Chang, et autres
Publié: (2026)
par: Liu, Chang, et autres
Publié: (2026)
Projected Coupled Diffusion for Test-Time Constrained Joint Generation
par: Luan, Hao, et autres
Publié: (2025)
par: Luan, Hao, et autres
Publié: (2025)
Representation Without Reward: A JEPA Audit for LLM Fine-Tuning
par: Sengupta, Biswa
Publié: (2026)
par: Sengupta, Biswa
Publié: (2026)
DARTS: Targeting Prognostic Covariates in Budget-Constrained Sequential Experiments
par: Husar, Kateryna, et autres
Publié: (2026)
par: Husar, Kateryna, et autres
Publié: (2026)
Noise-Response Calibration: A Causal Intervention Protocol for LLM-Judges
par: Khomiakov, Maxim, et autres
Publié: (2026)
par: Khomiakov, Maxim, et autres
Publié: (2026)
Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation
par: Tripathi, Tuhina, et autres
Publié: (2025)
par: Tripathi, Tuhina, et autres
Publié: (2025)
Constrained Best Arm Identification with Tests for Feasibility
par: Cai, Ting, et autres
Publié: (2025)
par: Cai, Ting, et autres
Publié: (2025)
Documents similaires
-
FastUMAP: Scalable Dimensionality Reduction via Bipartite Landmark Sampling
par: Li, Hongmin
Publié: (2026) -
A Controlled Counterexample to Strong Proxy-Based Explanations of OOD Performance: in a Fixed Pretraining-and-Probing Setup
par: Li, Hongmin
Publié: (2026) -
Separating Shortcut Transition from Cross-Family OOD Failure in a Minimal Model
par: Li, Hongmin
Publié: (2026) -
ISAAC: Auditing Causal Reasoning in Deep Models for Drug-Target Interaction
par: Tarantino, Barbara, et autres
Publié: (2026) -
Automated Network Protocol Testing with LLM Agents
par: Wei, Yunze, et autres
Publié: (2025)