Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kumarage, Tharindu, Bauer, Lisa, Ma, Yao, Rosen, Dan, Guduri, Yashasvi Raghavendra, Rumshisky, Anna, Chang, Kai-Wei, Galstyan, Aram, Gupta, Rahul, Peris, Charith |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System
par: Liang, Jiacheng, et autres
Publié: (2026)
par: Liang, Jiacheng, et autres
Publié: (2026)
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation
par: Kumarage, Tharindu, et autres
Publié: (2025)
par: Kumarage, Tharindu, et autres
Publié: (2025)
Kaleidoscopic Teaming in Multi Agent Simulations
par: Mehrabi, Ninareh, et autres
Publié: (2025)
par: Mehrabi, Ninareh, et autres
Publié: (2025)
Tree-of-Traversals: A Zero-Shot Reasoning Algorithm for Augmenting Black-box Language Models with Knowledge Graphs
par: Markowitz, Elan, et autres
Publié: (2024)
par: Markowitz, Elan, et autres
Publié: (2024)
K-Edit: Language Model Editing with Contextual Knowledge Awareness
par: Markowitz, Elan, et autres
Publié: (2025)
par: Markowitz, Elan, et autres
Publié: (2025)
On the steerability of large language models toward data-driven personas
par: Li, Junyi, et autres
Publié: (2023)
par: Li, Junyi, et autres
Publié: (2023)
Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification
par: Meng, Tao, et autres
Publié: (2024)
par: Meng, Tao, et autres
Publié: (2024)
SWAN: Semantic Watermarking with Abstract Meaning Representation
par: Ye, Ziping, et autres
Publié: (2026)
par: Ye, Ziping, et autres
Publié: (2026)
Data Advisor: Dynamic Data Curation for Safety Alignment of Large Language Models
par: Wang, Fei, et autres
Publié: (2024)
par: Wang, Fei, et autres
Publié: (2024)
Harnessing Artificial Intelligence to Combat Online Hate: Exploring the Challenges and Opportunities of Large Language Models in Hate Speech Detection
par: Kumarage, Tharindu, et autres
Publié: (2024)
par: Kumarage, Tharindu, et autres
Publié: (2024)
Prompt Perturbation Consistency Learning for Robust Language Models
par: Qiang, Yao, et autres
Publié: (2024)
par: Qiang, Yao, et autres
Publié: (2024)
Evaluating Differentially Private Synthetic Data Generation in High-Stakes Domains
par: Ramesh, Krithika, et autres
Publié: (2024)
par: Ramesh, Krithika, et autres
Publié: (2024)
Emergent Abilities in Reduced-Scale Generative Language Models
par: Muckatira, Sherin, et autres
Publié: (2024)
par: Muckatira, Sherin, et autres
Publié: (2024)
Can Knowledge Graphs Reduce Hallucinations in LLMs? : A Survey
par: Agrawal, Garima, et autres
Publié: (2023)
par: Agrawal, Garima, et autres
Publié: (2023)
Mindful-RAG: A Study of Points of Failure in Retrieval Augmented Generation
par: Agrawal, Garima, et autres
Publié: (2024)
par: Agrawal, Garima, et autres
Publié: (2024)
Sustainable AI Training via Hardware-Software Co-Design on NVIDIA, AMD, and Emerging GPU Architectures
par: Makin, Yashasvi, et autres
Publié: (2025)
par: Makin, Yashasvi, et autres
Publié: (2025)
RedditESS: A Mental Health Social Support Interaction Dataset -- Understanding Effective Social Support to Refine AI-Driven Support Tools
par: Alghamdi, Zeyad, et autres
Publié: (2025)
par: Alghamdi, Zeyad, et autres
Publié: (2025)
Geometry over Density: Few-Shot Cross-Domain OOD Detection
par: Li, Shawn, et autres
Publié: (2026)
par: Li, Shawn, et autres
Publié: (2026)
KG-LLM-Bench: A Scalable Benchmark for Evaluating LLM Reasoning on Textualized Knowledge Graphs
par: Markowitz, Elan, et autres
Publié: (2025)
par: Markowitz, Elan, et autres
Publié: (2025)
Tokenization Matters: Navigating Data-Scarce Tokenization for Gender Inclusive Language Technologies
par: Ovalle, Anaelia, et autres
Publié: (2023)
par: Ovalle, Anaelia, et autres
Publié: (2023)
FLIRT: Feedback Loop In-context Red Teaming
par: Mehrabi, Ninareh, et autres
Publié: (2023)
par: Mehrabi, Ninareh, et autres
Publié: (2023)
Cross-Platform Hate Speech Detection with Weakly Supervised Causal Disentanglement
par: Sheth, Paras, et autres
Publié: (2024)
par: Sheth, Paras, et autres
Publié: (2024)
Making Sense Of Distributed Representations With Activation Spectroscopy
par: Reing, Kyle, et autres
Publié: (2025)
par: Reing, Kyle, et autres
Publié: (2025)
Learning Morphisms with Gauss-Newton Approximation for Growing Networks
par: Lawton, Neal, et autres
Publié: (2024)
par: Lawton, Neal, et autres
Publié: (2024)
Regularizing Calabi-Yau topological conformal field theories using cutoff heat kernels
par: Aulak, Yashasvi
Publié: (2024)
par: Aulak, Yashasvi
Publié: (2024)
Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting
par: Wynn, Andrea, et autres
Publié: (2025)
par: Wynn, Andrea, et autres
Publié: (2025)
Partial Federated Learning
par: Feng, Tiantian, et autres
Publié: (2024)
par: Feng, Tiantian, et autres
Publié: (2024)
The Impact of Depression, Anxiety, and Stress on Cognitive Conflict in University Students
par: Yashasvi Walia, et autres
Publié: (2025)
par: Yashasvi Walia, et autres
Publié: (2025)
NarrativeTime: Dense Temporal Annotation on a Timeline
par: Rogers, Anna, et autres
Publié: (2019)
par: Rogers, Anna, et autres
Publié: (2019)
A Survey of AI-generated Text Forensic Systems: Detection, Attribution, and Characterization
par: Kumarage, Tharindu, et autres
Publié: (2024)
par: Kumarage, Tharindu, et autres
Publié: (2024)
Adaptive Video Understanding Agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning
par: Jeoung, Sullam, et autres
Publié: (2024)
par: Jeoung, Sullam, et autres
Publié: (2024)
Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models
par: Tsaprazlis, Efthymios, et autres
Publié: (2025)
par: Tsaprazlis, Efthymios, et autres
Publié: (2025)
Unraveling circadian rhythms—computational insights into molecular mechanisms
par: Yashasvi Rao, et autres
Publié: (2026)
par: Yashasvi Rao, et autres
Publié: (2026)
Deconstructing In-Context Learning: Understanding Prompts via Corruption
par: Shivagunde, Namrata, et autres
Publié: (2024)
par: Shivagunde, Namrata, et autres
Publié: (2024)
Scaling Down to Scale Up: A Guide to Parameter-Efficient Fine-Tuning
par: Lialin, Vladislav, et autres
Publié: (2023)
par: Lialin, Vladislav, et autres
Publié: (2023)
A Pre-Training Analogue of Grokking in Language Models: Tracing Delayed Grammatical Generalization
par: Muckatira, Sherin, et autres
Publié: (2026)
par: Muckatira, Sherin, et autres
Publié: (2026)
Beyond Perplexity: A Geometric and Spectral Study of Low-Rank Pre-Training
par: Shivagunde, Namrata, et autres
Publié: (2026)
par: Shivagunde, Namrata, et autres
Publié: (2026)
From Narrow Unlearning to Emergent Misalignment: Causes, Consequences, and Containment in LLMs
par: Mushtaq, Erum, et autres
Publié: (2025)
par: Mushtaq, Erum, et autres
Publié: (2025)
Emergent Language: A Survey and Taxonomy
par: Peters, Jannik, et autres
Publié: (2024)
par: Peters, Jannik, et autres
Publié: (2024)
Minimal Parametric Networks in Hyperspaces and their Properties
par: Galstyan, Arsen
Publié: (2026)
par: Galstyan, Arsen
Publié: (2026)
Documents similaires
-
ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System
par: Liang, Jiacheng, et autres
Publié: (2026) -
Towards Safety Reasoning in LLMs: AI-agentic Deliberation for Policy-embedded CoT Data Creation
par: Kumarage, Tharindu, et autres
Publié: (2025) -
Kaleidoscopic Teaming in Multi Agent Simulations
par: Mehrabi, Ninareh, et autres
Publié: (2025) -
Tree-of-Traversals: A Zero-Shot Reasoning Algorithm for Augmenting Black-box Language Models with Knowledge Graphs
par: Markowitz, Elan, et autres
Publié: (2024) -
K-Edit: Language Model Editing with Contextual Knowledge Awareness
par: Markowitz, Elan, et autres
Publié: (2025)