LookAhead Tuning: Safer Language Models via Partial Answer Previews
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Kangwei, Wang, Mengru, Luo, Yujie, Yuan, Lin, Sun, Mengshu, Liang, Lei, Zhang, Zhiqiang, Zhou, Jun, Hooi, Bryan, Deng, Shumin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Automating Steering for Safe Multimodal Large Language Models
por: Wu, Lyucheng, et al.
Publicado: (2025)
por: Wu, Lyucheng, et al.
Publicado: (2025)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
por: Deng, Ailin, et al.
Publicado: (2024)
por: Deng, Ailin, et al.
Publicado: (2024)
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
por: Deng, Ailin, et al.
Publicado: (2025)
por: Deng, Ailin, et al.
Publicado: (2025)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
por: Wu, Jiaying, et al.
Publicado: (2025)
por: Wu, Jiaying, et al.
Publicado: (2025)
RDTF: Resource-efficient Dual-mask Training Framework for Multi-frame Animated Sticker Generation
por: Yuan, Zhiqiang, et al.
Publicado: (2025)
por: Yuan, Zhiqiang, et al.
Publicado: (2025)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Looking Backward: Streaming Video-to-Video Translation with Feature Banks
por: Liang, Feng, et al.
Publicado: (2024)
por: Liang, Feng, et al.
Publicado: (2024)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
LightThinker: Thinking Step-by-Step Compression
por: Zhang, Jintian, et al.
Publicado: (2025)
por: Zhang, Jintian, et al.
Publicado: (2025)
CLIP-PCQA: Exploring Subjective-Aligned Vision-Language Modeling for Point Cloud Quality Assessment
por: Liu, Yating, et al.
Publicado: (2025)
por: Liu, Yating, et al.
Publicado: (2025)
Towards A Unified View of Answer Calibration for Multi-Step Reasoning
por: Deng, Shumin, et al.
Publicado: (2023)
por: Deng, Shumin, et al.
Publicado: (2023)
Controllable Expressive 3D Facial Animation via Diffusion in a Unified Multimodal Space
por: Liu, Kangwei, et al.
Publicado: (2025)
por: Liu, Kangwei, et al.
Publicado: (2025)
Diverse Sign Language Translation
por: Shen, Xin, et al.
Publicado: (2024)
por: Shen, Xin, et al.
Publicado: (2024)
Vision-Language Models Learn Super Images for Efficient Partially Relevant Video Retrieval
por: Nishimura, Taichi, et al.
Publicado: (2023)
por: Nishimura, Taichi, et al.
Publicado: (2023)
AIM: Let Any Multi-modal Large Language Models Embrace Efficient In-Context Learning
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference
por: Shen, Kai, et al.
Publicado: (2024)
por: Shen, Kai, et al.
Publicado: (2024)
To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models
por: Tian, Bozhong, et al.
Publicado: (2024)
por: Tian, Bozhong, et al.
Publicado: (2024)
Multimodal Infusion Tuning for Large Models
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
SoMeLVLM: A Large Vision Language Model for Social Media Processing
por: Zhang, Xinnong, et al.
Publicado: (2024)
por: Zhang, Xinnong, et al.
Publicado: (2024)
MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter
por: Liu, Zhiyuan, et al.
Publicado: (2023)
por: Liu, Zhiyuan, et al.
Publicado: (2023)
Unraveling Instance Associations: A Closer Look for Audio-Visual Segmentation
por: Chen, Yuanhong, et al.
Publicado: (2023)
por: Chen, Yuanhong, et al.
Publicado: (2023)
Look, Compare and Draw: Differential Query Transformer for Automatic Oil Painting
por: Liu, Lingyu, et al.
Publicado: (2026)
por: Liu, Lingyu, et al.
Publicado: (2026)
PRVR: Partially Relevant Video Retrieval
por: Chen, Xianke, et al.
Publicado: (2022)
por: Chen, Xianke, et al.
Publicado: (2022)
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
por: Wu, Yi, et al.
Publicado: (2025)
por: Wu, Yi, et al.
Publicado: (2025)
EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model
por: Li, Deng, et al.
Publicado: (2024)
por: Li, Deng, et al.
Publicado: (2024)
HeGraphAdapter: Tuning Multi-Modal Vision-Language Models with Heterogeneous Graph Adapter
por: Zhao, Yumiao, et al.
Publicado: (2024)
por: Zhao, Yumiao, et al.
Publicado: (2024)
FreeEnhance: Tuning-Free Image Enhancement via Content-Consistent Noising-and-Denoising Process
por: Luo, Yang, et al.
Publicado: (2024)
por: Luo, Yang, et al.
Publicado: (2024)
LAPIG: Language Guided Projector Image Generation with Surface Adaptation and Stylization
por: Deng, Yuchen, et al.
Publicado: (2025)
por: Deng, Yuchen, et al.
Publicado: (2025)
QuantTune: Optimizing Model Quantization with Adaptive Outlier-Driven Fine Tuning
por: Chen, Jiun-Man, et al.
Publicado: (2024)
por: Chen, Jiun-Man, et al.
Publicado: (2024)
Lost in Overlap: Exploring Logit-based Watermark Collision in LLMs
por: Luo, Yiyang, et al.
Publicado: (2024)
por: Luo, Yiyang, et al.
Publicado: (2024)
Towards Explainable Partial-AIGC Image Quality Assessment
por: Qian, Jiaying, et al.
Publicado: (2025)
por: Qian, Jiaying, et al.
Publicado: (2025)
An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM
por: Liu, Jiawei, et al.
Publicado: (2025)
por: Liu, Jiawei, et al.
Publicado: (2025)
MMPKUBase: A Comprehensive and High-quality Chinese Multi-modal Knowledge Graph
por: Yi, Xuan, et al.
Publicado: (2024)
por: Yi, Xuan, et al.
Publicado: (2024)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
por: Zhang, Long, et al.
Publicado: (2025)
por: Zhang, Long, et al.
Publicado: (2025)
LAVE: LLM-Powered Agent Assistance and Language Augmentation for Video Editing
por: Wang, Bryan, et al.
Publicado: (2024)
por: Wang, Bryan, et al.
Publicado: (2024)
Unravelling the Power of Single-Pass Look-Ahead in Modern Codecs for Optimized Transcoding Deployment
por: Vibhoothi, Vibhoothi, et al.
Publicado: (2024)
por: Vibhoothi, Vibhoothi, et al.
Publicado: (2024)
VidTune: Creating Video Soundtracks with Generative Music and Contextual Thumbnails
por: Huh, Mina, et al.
Publicado: (2026)
por: Huh, Mina, et al.
Publicado: (2026)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
por: Luo, Chuwei, et al.
Publicado: (2022)
por: Luo, Chuwei, et al.
Publicado: (2022)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
por: Jiang, Chen, et al.
Publicado: (2023)
por: Jiang, Chen, et al.
Publicado: (2023)
Ejemplares similares
-
Automating Steering for Safe Multimodal Large Language Models
por: Wu, Lyucheng, et al.
Publicado: (2025) -
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
por: Deng, Ailin, et al.
Publicado: (2024) -
Words or Vision: Do Vision-Language Models Have Blind Faith in Text?
por: Deng, Ailin, et al.
Publicado: (2025) -
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
por: Wu, Jiaying, et al.
Publicado: (2025) -
RDTF: Resource-efficient Dual-mask Training Framework for Multi-frame Animated Sticker Generation
por: Yuan, Zhiqiang, et al.
Publicado: (2025)