Guardado en:
| Autores principales: | Wang, Haoxiang, Yu, Da, Zhang, Huishuai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.06213 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Synthesize Privacy-Preserving High-Resolution Images via Private Textual Intermediaries
por: Wang, Haoxiang, et al.
Publicado: (2025)
por: Wang, Haoxiang, et al.
Publicado: (2025)
How Worst-Case Are Adversarial Attacks? Linking Adversarial and Perturbation Robustness
por: Rossolini, Giulio
Publicado: (2026)
por: Rossolini, Giulio
Publicado: (2026)
Worst-Case Symbolic Constraints Analysis and Generalisation with Large Language Models
por: Koh, Daniel, et al.
Publicado: (2025)
por: Koh, Daniel, et al.
Publicado: (2025)
On the Worst Prompt Performance of Large Language Models
por: Cao, Bowen, et al.
Publicado: (2024)
por: Cao, Bowen, et al.
Publicado: (2024)
OLion: Approaching the Hadamard Ideal by Intersecting Spectral and $\ell_{\infty}$ Implicit Biases
por: Wang, Zixiao, et al.
Publicado: (2026)
por: Wang, Zixiao, et al.
Publicado: (2026)
AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training
por: Zhang, Huishuai, et al.
Publicado: (2025)
por: Zhang, Huishuai, et al.
Publicado: (2025)
Learning to Generate Formally Verifiable Step-by-Step Logic Reasoning via Structured Formal Intermediaries
por: Chen, Luoxin, et al.
Publicado: (2026)
por: Chen, Luoxin, et al.
Publicado: (2026)
Evidence-Enhanced Triplet Generation Framework for Hallucination Alleviation in Generative Question Answering
por: Du, Haowei, et al.
Publicado: (2024)
por: Du, Haowei, et al.
Publicado: (2024)
Beyond Prompts: Dynamic Conversational Benchmarking of Large Language Models
por: Castillo-Bolado, David, et al.
Publicado: (2024)
por: Castillo-Bolado, David, et al.
Publicado: (2024)
Estimating Worst-Case Frontier Risks of Open-Weight LLMs
por: Wallace, Eric, et al.
Publicado: (2025)
por: Wallace, Eric, et al.
Publicado: (2025)
Beyond A Fixed Seal: Adaptive Stealing Watermark in Large Language Models
por: Zhang, Shuhao, et al.
Publicado: (2026)
por: Zhang, Shuhao, et al.
Publicado: (2026)
Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models
por: Guo, Pei-Fu, et al.
Publicado: (2026)
por: Guo, Pei-Fu, et al.
Publicado: (2026)
Building Decision Making Models Through Language Model Regime
por: Zhang, Yu, et al.
Publicado: (2024)
por: Zhang, Yu, et al.
Publicado: (2024)
Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text
por: Greenfeld, Refael Shaked, et al.
Publicado: (2026)
por: Greenfeld, Refael Shaked, et al.
Publicado: (2026)
Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks
por: Li, Yuangang, et al.
Publicado: (2026)
por: Li, Yuangang, et al.
Publicado: (2026)
ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts
por: Johns, Sydney, et al.
Publicado: (2026)
por: Johns, Sydney, et al.
Publicado: (2026)
©Plug-in Authorization for Human Content Copyright Protection in Text-to-Image Model
por: Zhou, Chao, et al.
Publicado: (2024)
por: Zhou, Chao, et al.
Publicado: (2024)
Enterprise Large Language Model Evaluation Benchmark
por: Wang, Liya, et al.
Publicado: (2025)
por: Wang, Liya, et al.
Publicado: (2025)
In-context Pretraining: Language Modeling Beyond Document Boundaries
por: Shi, Weijia, et al.
Publicado: (2023)
por: Shi, Weijia, et al.
Publicado: (2023)
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
por: Shi, Zhichao, et al.
Publicado: (2025)
por: Shi, Zhichao, et al.
Publicado: (2025)
Towards Generalist Prompting for Large Language Models by Mental Models
por: Guan, Haoxiang, et al.
Publicado: (2024)
por: Guan, Haoxiang, et al.
Publicado: (2024)
Sasha: Creative Goal-Oriented Reasoning in Smart Homes with Large Language Models
por: King, Evan, et al.
Publicado: (2023)
por: King, Evan, et al.
Publicado: (2023)
AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
por: Zhang, Tanghaoran, et al.
Publicado: (2026)
AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
por: Li, Jiayu, et al.
Publicado: (2025)
por: Li, Jiayu, et al.
Publicado: (2025)
Beyond Facts: Evaluating Intent Hallucination in Large Language Models
por: Hao, Yijie, et al.
Publicado: (2025)
por: Hao, Yijie, et al.
Publicado: (2025)
The Evaluation Game: Beyond Static LLM Benchmarking
por: Wang, Paul, et al.
Publicado: (2026)
por: Wang, Paul, et al.
Publicado: (2026)
Beyond Boundaries: A Comprehensive Survey of Transferable Attacks on AI Systems
por: Wang, Guangjing, et al.
Publicado: (2023)
por: Wang, Guangjing, et al.
Publicado: (2023)
Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models
por: Zheng, Baihui, et al.
Publicado: (2025)
por: Zheng, Baihui, et al.
Publicado: (2025)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
por: Della Libera, Luca, et al.
Publicado: (2026)
por: Della Libera, Luca, et al.
Publicado: (2026)
Provably Efficient Exploration in Quantum Reinforcement Learning with Logarithmic Worst-Case Regret
por: Zhong, Han, et al.
Publicado: (2023)
por: Zhong, Han, et al.
Publicado: (2023)
Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap
por: Wang, Jun, et al.
Publicado: (2025)
por: Wang, Jun, et al.
Publicado: (2025)
Large Language Models Leverage External Knowledge to Extend Clinical Insight Beyond Language Boundaries
por: Wu, Jiageng, et al.
Publicado: (2023)
por: Wu, Jiageng, et al.
Publicado: (2023)
Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models
por: Yang, Wanqi, et al.
Publicado: (2024)
por: Yang, Wanqi, et al.
Publicado: (2024)
DeepMath-Creative: A Benchmark for Evaluating Mathematical Creativity of Large Language Models
por: Chen, Xiaoyang, et al.
Publicado: (2025)
por: Chen, Xiaoyang, et al.
Publicado: (2025)
CPSDBench: A Large Language Model Evaluation Benchmark and Baseline for Chinese Public Security Domain
por: Tong, Xin, et al.
Publicado: (2024)
por: Tong, Xin, et al.
Publicado: (2024)
CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation
por: Yin, Wenjing, et al.
Publicado: (2025)
por: Yin, Wenjing, et al.
Publicado: (2025)
Approximate Information States for Worst-Case Control and Learning in Uncertain Systems
por: Dave, Aditya, et al.
Publicado: (2023)
por: Dave, Aditya, et al.
Publicado: (2023)
Worst-Case Regret Bounds for Exploration via Randomized Value Functions
por: Russo, Daniel
Publicado: (2019)
por: Russo, Daniel
Publicado: (2019)
Beyond Instruction Following: Evaluating Inferential Rule Following of Large Language Models
por: Sun, Wangtao, et al.
Publicado: (2024)
por: Sun, Wangtao, et al.
Publicado: (2024)
Automatic and Universal Prompt Injection Attacks against Large Language Models
por: Liu, Xiaogeng, et al.
Publicado: (2024)
por: Liu, Xiaogeng, et al.
Publicado: (2024)
Ejemplares similares
-
Synthesize Privacy-Preserving High-Resolution Images via Private Textual Intermediaries
por: Wang, Haoxiang, et al.
Publicado: (2025) -
How Worst-Case Are Adversarial Attacks? Linking Adversarial and Perturbation Robustness
por: Rossolini, Giulio
Publicado: (2026) -
Worst-Case Symbolic Constraints Analysis and Generalisation with Large Language Models
por: Koh, Daniel, et al.
Publicado: (2025) -
On the Worst Prompt Performance of Large Language Models
por: Cao, Bowen, et al.
Publicado: (2024) -
OLion: Approaching the Hadamard Ideal by Intersecting Spectral and $\ell_{\infty}$ Implicit Biases
por: Wang, Zixiao, et al.
Publicado: (2026)