SibylSense: Adaptive Rubric Learning via Memory Tuning and Adversarial Probing
Fuente:
arXiv
Guardado en:
| Autores principales: | Xu, Yifei, Potje, Guilherme, Shandilya, Shivam, Yuan, Tiancheng, Nunes, Leonardo de Oliveira, Agarwal, Rakshanda, Asgari, Saeid, Atkinson, Adam, Kıcıman, Emre, Lu, Songwu, Chandra, Ranveer, Chakraborty, Tusher |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diagnosing Capability Gaps in Fine-Tuning Data
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2026)
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2026)
Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks
por: Xu, Yifei, et al.
Publicado: (2025)
por: Xu, Yifei, et al.
Publicado: (2025)
RLTHF: Targeted Human Feedback for LLM Alignment
por: Xu, Yifei, et al.
Publicado: (2025)
por: Xu, Yifei, et al.
Publicado: (2025)
Orchestration for Domain-specific Edge-Cloud Language Models
por: Patidar, Prasoon, et al.
Publicado: (2025)
por: Patidar, Prasoon, et al.
Publicado: (2025)
Domain Adaptation for Sustainable Soil Management using Causal and Contrastive Constraint Minimization
por: Sharma, Somya, et al.
Publicado: (2024)
por: Sharma, Somya, et al.
Publicado: (2024)
Enabling Adoption of Regenerative Agriculture through Soil Carbon Copilots
por: Capetz, Margaret, et al.
Publicado: (2024)
por: Capetz, Margaret, et al.
Publicado: (2024)
Sibyll$^{\bigstar}$
por: Riehn, Felix, et al.
Publicado: (2024)
por: Riehn, Felix, et al.
Publicado: (2024)
Head of a Sibyl
por: Scan-the-World
Publicado: (2026)
por: Scan-the-World
Publicado: (2026)
Modeling the Data-Generating Process is Necessary for Out-of-Distribution Generalization
por: Kaur, Jivat Neet, et al.
Publicado: (2022)
por: Kaur, Jivat Neet, et al.
Publicado: (2022)
Causal Reasoning and Large Language Models: Opening a New Frontier for Causality
por: Kıcıman, Emre, et al.
Publicado: (2023)
por: Kıcıman, Emre, et al.
Publicado: (2023)
Inverse design of heterodeformations for strain soliton networks in bilayer 2D materials
por: Ahmed, Md Tusher, et al.
Publicado: (2026)
por: Ahmed, Md Tusher, et al.
Publicado: (2026)
Explain-Query-Test: Self-Evaluating LLMs Via Explanation and Comprehension Discrepancy
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2025)
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2025)
Detecting Generative Parroting through Overfitting Masked Autoencoders
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2024)
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2024)
Sibyl: Forecasting Time-Evolving Query Workloads
por: Huang, Hanxian, et al.
Publicado: (2024)
por: Huang, Hanxian, et al.
Publicado: (2024)
DeepSpecs: Expert-Level Questions Answering in 5G
por: Manvattira, Aman Ganapathy, et al.
Publicado: (2025)
por: Manvattira, Aman Ganapathy, et al.
Publicado: (2025)
Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations
por: Matton, Katie, et al.
Publicado: (2025)
por: Matton, Katie, et al.
Publicado: (2025)
Narcotweets: Social Media in Wartime
por: Monroy-Hernández, Andrés, et al.
Publicado: (2015)
por: Monroy-Hernández, Andrés, et al.
Publicado: (2015)
XFeat: Accelerated Features for Lightweight Image Matching
por: Potje, Guilherme, et al.
Publicado: (2024)
por: Potje, Guilherme, et al.
Publicado: (2024)
Leveraging Semantic Cues from Foundation Vision Models for Enhanced Local Feature Correspondence
por: Cadar, Felipe, et al.
Publicado: (2024)
por: Cadar, Felipe, et al.
Publicado: (2024)
Enterprise AI Must Enforce Participant-Aware Access Control
por: Bhatt, Shashank Shreedhar, et al.
Publicado: (2025)
por: Bhatt, Shashank Shreedhar, et al.
Publicado: (2025)
MemeMQA: Multimodal Question Answering for Memes via Rationale-Based Inferencing
por: Agarwal, Siddhant, et al.
Publicado: (2024)
por: Agarwal, Siddhant, et al.
Publicado: (2024)
MMLU-Pro+: Evaluating Higher-Order Reasoning and Shortcut Learning in LLMs
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2024)
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2024)
How to Determine the Preferred Image Distribution of a Black-Box Vision-Language Model?
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2024)
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2024)
Exploring the Efficiency of Renewable Energy-based Modular Data Centers at Scale
por: Sun, Jinghan, et al.
Publicado: (2024)
por: Sun, Jinghan, et al.
Publicado: (2024)
Sibyl: Simple yet Effective Agent Framework for Complex Real-world Reasoning
por: Wang, Yulong, et al.
Publicado: (2024)
por: Wang, Yulong, et al.
Publicado: (2024)
Defending Against Indirect Prompt Injection Attacks With Spotlighting
por: Hines, Keegan, et al.
Publicado: (2024)
por: Hines, Keegan, et al.
Publicado: (2024)
Wireless Spectrum in Rural Farmlands: Status, Challenges and Opportunities
por: Shahid, Mukaram, et al.
Publicado: (2024)
por: Shahid, Mukaram, et al.
Publicado: (2024)
Probing Protease‐Mediated Decrease of Albumin‐Catalyzed Kemp Elimination: Potential Application as Biosensors
por: Shikha Shikha, et al.
Publicado: (2025)
por: Shikha Shikha, et al.
Publicado: (2025)
Multiscale analysis of large twist ferroelectricity and swirling dislocations in bilayer hexagonal boron nitride
por: Ahmed, Md Tusher, et al.
Publicado: (2025)
por: Ahmed, Md Tusher, et al.
Publicado: (2025)
SibylSat: Using SAT as an Oracle to Perform a Greedy Search on TOHTN Planning
por: Quenard, Gaspard, et al.
Publicado: (2024)
por: Quenard, Gaspard, et al.
Publicado: (2024)
Configurable Preference Tuning with Rubric-Guided Synthetic Data
por: Gallego, Víctor
Publicado: (2025)
por: Gallego, Víctor
Publicado: (2025)
Algebraic Structures In Closed Superstring Field Theory, Homotopy Transfer And Effective Actions
por: Singh, Ranveer Kumar
Publicado: (2024)
por: Singh, Ranveer Kumar
Publicado: (2024)
Tuning Interfacial Charge Transfer and Exploring Morphological Insight in Biocarbon/MoSe 2 Heterostructures for Enhanced Photodegradation of Organic Pollutants
por: Shivam Tyagi, et al.
Publicado: (2025)
por: Shivam Tyagi, et al.
Publicado: (2025)
Decoding Memes: Benchmarking Narrative Role Classification across Multilingual and Multimodal Models
por: Sharma, Shivam, et al.
Publicado: (2025)
por: Sharma, Shivam, et al.
Publicado: (2025)
Quantifying superlubricity of bilayer graphene from the mobility of interface dislocations
por: Ahmed, Md Tusher, et al.
Publicado: (2025)
por: Ahmed, Md Tusher, et al.
Publicado: (2025)
Injecting New Knowledge into Large Language Models via Supervised Fine-Tuning
por: Mecklenburg, Nick, et al.
Publicado: (2024)
por: Mecklenburg, Nick, et al.
Publicado: (2024)
Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models
por: Yi, Jingwei, et al.
Publicado: (2023)
por: Yi, Jingwei, et al.
Publicado: (2023)
Scale-(in)dependence in quantum 4-body scattering
por: Mondal, Sourav, et al.
Publicado: (2024)
por: Mondal, Sourav, et al.
Publicado: (2024)
Beyond QA Pairs: Assessing Parameter-Efficient Fine-Tuning for Fact Embedding in LLMs
por: Ratnakar, Shivam, et al.
Publicado: (2025)
por: Ratnakar, Shivam, et al.
Publicado: (2025)
LLM Essay Scoring Under Holistic and Analytic Rubrics: Prompt Effects and Bias
por: Kucia, Filip J., et al.
Publicado: (2026)
por: Kucia, Filip J., et al.
Publicado: (2026)
Ejemplares similares
-
Diagnosing Capability Gaps in Fine-Tuning Data
por: Taghanaki, Saeid Asgari, et al.
Publicado: (2026) -
Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks
por: Xu, Yifei, et al.
Publicado: (2025) -
RLTHF: Targeted Human Feedback for LLM Alignment
por: Xu, Yifei, et al.
Publicado: (2025) -
Orchestration for Domain-specific Edge-Cloud Language Models
por: Patidar, Prasoon, et al.
Publicado: (2025) -
Domain Adaptation for Sustainable Soil Management using Causal and Contrastive Constraint Minimization
por: Sharma, Somya, et al.
Publicado: (2024)