Three Concrete Challenges and Two Hopes for the Safety of Unsupervised Elicitation
Fuente:
arXiv
Salvato in:
| Autori principali: | Canavan, Callum, Shrivastava, Aditya, Qi, Allison, Michala, Jonathan, Roger, Fabien |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Stabilising Explainability Fragility in Cybersecurity AI: The Impact and Mitigation of Multicollinearity in Public Benchmark Datasets
di: Vourganas, Ioannis J., et al.
Pubblicazione: (2026)
di: Vourganas, Ioannis J., et al.
Pubblicazione: (2026)
The Elicitation Game: Evaluating Capability Elicitation Techniques
di: Hofstätter, Felix, et al.
Pubblicazione: (2025)
di: Hofstätter, Felix, et al.
Pubblicazione: (2025)
A Concrete Roadmap towards Safety Cases based on Chain-of-Thought Monitoring
di: Schulz, Julian
Pubblicazione: (2025)
di: Schulz, Julian
Pubblicazione: (2025)
Generative Kaleidoscopic Networks
di: Shrivastava, Harsh
Pubblicazione: (2024)
di: Shrivastava, Harsh
Pubblicazione: (2024)
Reasoning Elicitation in Language Models via Counterfactual Feedback
di: Hüyük, Alihan, et al.
Pubblicazione: (2024)
di: Hüyük, Alihan, et al.
Pubblicazione: (2024)
Excess Description Length of Learning Generalizable Predictors
di: Donoway, Elizabeth, et al.
Pubblicazione: (2026)
di: Donoway, Elizabeth, et al.
Pubblicazione: (2026)
Self-Attribution Bias: When AI Monitors Go Easy on Themselves
di: Khullar, Dipika, et al.
Pubblicazione: (2026)
di: Khullar, Dipika, et al.
Pubblicazione: (2026)
Knowledge Propagation over Conditional Independence Graphs
di: Chajewska, Urszula, et al.
Pubblicazione: (2023)
di: Chajewska, Urszula, et al.
Pubblicazione: (2023)
Federated Learning with Neural Graphical Models
di: Chajewska, Urszula, et al.
Pubblicazione: (2023)
di: Chajewska, Urszula, et al.
Pubblicazione: (2023)
Surprise-Adaptive Intrinsic Motivation for Unsupervised Reinforcement Learning
di: Hugessen, Adriana, et al.
Pubblicazione: (2024)
di: Hugessen, Adriana, et al.
Pubblicazione: (2024)
Preference Elicitation for Offline Reinforcement Learning
di: Pace, Alizée, et al.
Pubblicazione: (2024)
di: Pace, Alizée, et al.
Pubblicazione: (2024)
Personalized Algorithmic Recourse with Preference Elicitation
di: De Toni, Giovanni, et al.
Pubblicazione: (2022)
di: De Toni, Giovanni, et al.
Pubblicazione: (2022)
Causal Preference Elicitation
di: Bonilla, Edwin V., et al.
Pubblicazione: (2026)
di: Bonilla, Edwin V., et al.
Pubblicazione: (2026)
All Code, No Thought: Current Language Models Struggle to Reason in Ciphered Language
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
di: Guo, Shiyuan, et al.
Pubblicazione: (2025)
Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges
di: Lu, Haoran, et al.
Pubblicazione: (2025)
di: Lu, Haoran, et al.
Pubblicazione: (2025)
Uncertainty in Action: Confidence Elicitation in Embodied Agents
di: Yu, Tianjiao, et al.
Pubblicazione: (2025)
di: Yu, Tianjiao, et al.
Pubblicazione: (2025)
Continuous Video Process: Modeling Videos as Continuous Multi-Dimensional Processes for Video Prediction
di: Shrivastava, Gaurav, et al.
Pubblicazione: (2024)
di: Shrivastava, Gaurav, et al.
Pubblicazione: (2024)
Eliciting Numerical Predictive Distributions of LLMs Without Autoregression
di: Piskorz, Julianna, et al.
Pubblicazione: (2026)
di: Piskorz, Julianna, et al.
Pubblicazione: (2026)
Dispelling the Mirage of Progress in Offline MARL through Standardised Baselines and Evaluation
di: Formanek, Claude, et al.
Pubblicazione: (2024)
di: Formanek, Claude, et al.
Pubblicazione: (2024)
Leveraging Machine Learning for Early Autism Detection via INDT-ASD Indian Database
di: Shrivastava, Trapti, et al.
Pubblicazione: (2024)
di: Shrivastava, Trapti, et al.
Pubblicazione: (2024)
Superintelligent Retrieval Agent: The Next Frontier of Information Retrieval
di: Yang, Zeyu, et al.
Pubblicazione: (2026)
di: Yang, Zeyu, et al.
Pubblicazione: (2026)
Embedding by Elicitation: Dynamic Representations for Bayesian Optimization of System Prompts
di: Lin, Zhiyuan Jerry, et al.
Pubblicazione: (2026)
di: Lin, Zhiyuan Jerry, et al.
Pubblicazione: (2026)
Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models
di: Lee, Sanghyun, et al.
Pubblicazione: (2025)
di: Lee, Sanghyun, et al.
Pubblicazione: (2025)
Can LLMs Assist Expert Elicitation for Probabilistic Causal Modeling?
di: Shaposhnyk, Olha, et al.
Pubblicazione: (2025)
di: Shaposhnyk, Olha, et al.
Pubblicazione: (2025)
Inference Time Context Sparsity: Illusion or Opportunity?
di: Joshi, Sahil, et al.
Pubblicazione: (2026)
di: Joshi, Sahil, et al.
Pubblicazione: (2026)
Equitable Evaluation via Elicitation
di: Du, Elbert, et al.
Pubblicazione: (2026)
di: Du, Elbert, et al.
Pubblicazione: (2026)
Self-Exploring Language Models: Active Preference Elicitation for Online Alignment
di: Zhang, Shenao, et al.
Pubblicazione: (2024)
di: Zhang, Shenao, et al.
Pubblicazione: (2024)
Synthetic Error Injection Fails to Elicit Self-Correction In Language Models
di: Wu, David X., et al.
Pubblicazione: (2025)
di: Wu, David X., et al.
Pubblicazione: (2025)
Eliciting Fine-Tuned Transformer Capabilities via Inference-Time Techniques
di: Sharma, Asankhaya
Pubblicazione: (2025)
di: Sharma, Asankhaya
Pubblicazione: (2025)
Synthesize, Partition, then Adapt: Eliciting Diverse Samples from Foundation Models
di: Wen, Yeming, et al.
Pubblicazione: (2024)
di: Wen, Yeming, et al.
Pubblicazione: (2024)
GLADMamba: Unsupervised Graph-Level Anomaly Detection Powered by Selective State Space Model
di: Fu, Yali, et al.
Pubblicazione: (2025)
di: Fu, Yali, et al.
Pubblicazione: (2025)
CVTGAD: Simplified Transformer with Cross-View Attention for Unsupervised Graph-level Anomaly Detection
di: Li, Jindong, et al.
Pubblicazione: (2024)
di: Li, Jindong, et al.
Pubblicazione: (2024)
Distillation of Large Language Models via Concrete Score Matching
di: Kim, Yeongmin, et al.
Pubblicazione: (2025)
di: Kim, Yeongmin, et al.
Pubblicazione: (2025)
Unsupervised Cognition
di: Ibias, Alfredo, et al.
Pubblicazione: (2024)
di: Ibias, Alfredo, et al.
Pubblicazione: (2024)
A Simple "Try Again" Can Elicit Multi-Turn LLM Reasoning
di: Liu, Licheng, et al.
Pubblicazione: (2025)
di: Liu, Licheng, et al.
Pubblicazione: (2025)
Beyond Johnson-Lindenstrauss: Uniform Bounds for Sketched Bilinear Forms
di: Deb, Rohan, et al.
Pubblicazione: (2025)
di: Deb, Rohan, et al.
Pubblicazione: (2025)
Triple Attention Transformer Architecture for Time-Dependent Concrete Creep Prediction
di: Dokduea, Warayut, et al.
Pubblicazione: (2025)
di: Dokduea, Warayut, et al.
Pubblicazione: (2025)
Language models are better than humans at next-token prediction
di: Shlegeris, Buck, et al.
Pubblicazione: (2022)
di: Shlegeris, Buck, et al.
Pubblicazione: (2022)
FANFOLD: Graph Normalizing Flows-driven Asymmetric Network for Unsupervised Graph-Level Anomaly Detection
di: Cao, Rui, et al.
Pubblicazione: (2024)
di: Cao, Rui, et al.
Pubblicazione: (2024)
Preference Elicitation for Multi-objective Combinatorial Optimization with Active Learning and Maximum Likelihood Estimation
di: Defresne, Marianne, et al.
Pubblicazione: (2025)
di: Defresne, Marianne, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Stabilising Explainability Fragility in Cybersecurity AI: The Impact and Mitigation of Multicollinearity in Public Benchmark Datasets
di: Vourganas, Ioannis J., et al.
Pubblicazione: (2026) -
The Elicitation Game: Evaluating Capability Elicitation Techniques
di: Hofstätter, Felix, et al.
Pubblicazione: (2025) -
A Concrete Roadmap towards Safety Cases based on Chain-of-Thought Monitoring
di: Schulz, Julian
Pubblicazione: (2025) -
Generative Kaleidoscopic Networks
di: Shrivastava, Harsh
Pubblicazione: (2024) -
Reasoning Elicitation in Language Models via Counterfactual Feedback
di: Hüyük, Alihan, et al.
Pubblicazione: (2024)