Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Lingfeng, Guo, Huizhong, Wei, Tianjun, Du, Yingpeng, Sun, Zhu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GaussianForest: Hierarchical-Hybrid 3D Gaussian Splatting for Compressed Scene Modeling
por: Zhang, Fengyi, et al.
Publicado: (2024)
por: Zhang, Fengyi, et al.
Publicado: (2024)
Natural Language Induced Adversarial Images
por: Zhu, Xiaopei, et al.
Publicado: (2024)
por: Zhu, Xiaopei, et al.
Publicado: (2024)
Multiverse Through Deepfakes: The MultiFakeVerse Dataset of Person-Centric Visual and Conceptual Manipulations
por: Gupta, Parul, et al.
Publicado: (2025)
por: Gupta, Parul, et al.
Publicado: (2025)
One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
QuantTune: Optimizing Model Quantization with Adaptive Outlier-Driven Fine Tuning
por: Chen, Jiun-Man, et al.
Publicado: (2024)
por: Chen, Jiun-Man, et al.
Publicado: (2024)
SCENEFORGE: Enhancing 3D-text alignment with Structured Scene Compositions
por: Sbrolli, Cristian, et al.
Publicado: (2025)
por: Sbrolli, Cristian, et al.
Publicado: (2025)
AIS 2024 Challenge on Video Quality Assessment of User-Generated Content: Methods and Results
por: Conde, Marcos V., et al.
Publicado: (2024)
por: Conde, Marcos V., et al.
Publicado: (2024)
Robust Duality Learning for Unsupervised Visible-Infrared Person Re-Identification
por: Li, Yongxiang, et al.
Publicado: (2025)
por: Li, Yongxiang, et al.
Publicado: (2025)
GAOT: Generating Articulated Objects Through Text-Guided Diffusion Models
por: Sun, Hao, et al.
Publicado: (2025)
por: Sun, Hao, et al.
Publicado: (2025)
Beyond Walking: A Large-Scale Image-Text Benchmark for Text-based Person Anomaly Search
por: Yang, Shuyu, et al.
Publicado: (2024)
por: Yang, Shuyu, et al.
Publicado: (2024)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
por: Yao, Linli, et al.
Publicado: (2023)
por: Yao, Linli, et al.
Publicado: (2023)
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
por: Wu, Yi, et al.
Publicado: (2025)
por: Wu, Yi, et al.
Publicado: (2025)
ProFD: Prompt-Guided Feature Disentangling for Occluded Person Re-Identification
por: Cui, Can, et al.
Publicado: (2024)
por: Cui, Can, et al.
Publicado: (2024)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
GSVC: Efficient Video Representation and Compression Through 2D Gaussian Splatting
por: Wang, Longan, et al.
Publicado: (2025)
por: Wang, Longan, et al.
Publicado: (2025)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
por: Meng, Yiran, et al.
Publicado: (2025)
por: Meng, Yiran, et al.
Publicado: (2025)
From Data Deluge to Data Curation: A Filtering-WoRA Paradigm for Efficient Text-based Person Search
por: Sun, Jintao, et al.
Publicado: (2024)
por: Sun, Jintao, et al.
Publicado: (2024)
Efficient Vision Language Model Fine-tuning for Text-based Person Anomaly Search
por: He, Jiayi, et al.
Publicado: (2025)
por: He, Jiayi, et al.
Publicado: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
DARA: Domain- and Relation-aware Adapters Make Parameter-efficient Tuning for Visual Grounding
por: Liu, Ting, et al.
Publicado: (2024)
por: Liu, Ting, et al.
Publicado: (2024)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance
por: Zhang, Beiyuan, et al.
Publicado: (2024)
por: Zhang, Beiyuan, et al.
Publicado: (2024)
Semantically Consistent Person Image Generation
por: Roy, Prasun, et al.
Publicado: (2023)
por: Roy, Prasun, et al.
Publicado: (2023)
Panonut360: A Head and Eye Tracking Dataset for Panoramic Video
por: Xu, Yutong, et al.
Publicado: (2024)
por: Xu, Yutong, et al.
Publicado: (2024)
AdaMesh: Personalized Facial Expressions and Head Poses for Adaptive Speech-Driven 3D Facial Animation
por: Chen, Liyang, et al.
Publicado: (2023)
por: Chen, Liyang, et al.
Publicado: (2023)
MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models
por: Guo, Zile, et al.
Publicado: (2026)
por: Guo, Zile, et al.
Publicado: (2026)
SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment
por: Mao, Xinyu, et al.
Publicado: (2025)
por: Mao, Xinyu, et al.
Publicado: (2025)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
Noisy-Correspondence Learning for Text-to-Image Person Re-identification
por: Qin, Yang, et al.
Publicado: (2023)
por: Qin, Yang, et al.
Publicado: (2023)
DRFormer: A Dual-Regularized Bidirectional Transformer for Person Re-identification
por: Shu, Ying, et al.
Publicado: (2026)
por: Shu, Ying, et al.
Publicado: (2026)
Scene Aware Person Image Generation through Global Contextual Conditioning
por: Roy, Prasun, et al.
Publicado: (2022)
por: Roy, Prasun, et al.
Publicado: (2022)
Predicting Satisfied User and Machine Ratio for Compressed Images: A Unified Approach
por: Zhang, Qi, et al.
Publicado: (2024)
por: Zhang, Qi, et al.
Publicado: (2024)
A Hierarchical Compression Technique for 3D Gaussian Splatting Compression
por: Huang, He, et al.
Publicado: (2024)
por: Huang, He, et al.
Publicado: (2024)
SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions
por: Tu, Jinzhe, et al.
Publicado: (2026)
por: Tu, Jinzhe, et al.
Publicado: (2026)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
por: Lu, Yiting, et al.
Publicado: (2025)
por: Lu, Yiting, et al.
Publicado: (2025)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
por: Li, Zeju, et al.
Publicado: (2024)
por: Li, Zeju, et al.
Publicado: (2024)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
por: Li, Haoyang, et al.
Publicado: (2025)
por: Li, Haoyang, et al.
Publicado: (2025)
UniPT: Universal Parallel Tuning for Transfer Learning with Efficient Parameter and Memory
por: Diao, Haiwen, et al.
Publicado: (2023)
por: Diao, Haiwen, et al.
Publicado: (2023)
Diverse Sign Language Translation
por: Shen, Xin, et al.
Publicado: (2024)
por: Shen, Xin, et al.
Publicado: (2024)
Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation
por: Wu, Xun, et al.
Publicado: (2024)
por: Wu, Xun, et al.
Publicado: (2024)
CAMeL: Cross-modality Adaptive Meta-Learning for Text-based Person Retrieval
por: Yu, Hang, et al.
Publicado: (2025)
por: Yu, Hang, et al.
Publicado: (2025)
Ejemplares similares
-
GaussianForest: Hierarchical-Hybrid 3D Gaussian Splatting for Compressed Scene Modeling
por: Zhang, Fengyi, et al.
Publicado: (2024) -
Natural Language Induced Adversarial Images
por: Zhu, Xiaopei, et al.
Publicado: (2024) -
Multiverse Through Deepfakes: The MultiFakeVerse Dataset of Person-Centric Visual and Conceptual Manipulations
por: Gupta, Parul, et al.
Publicado: (2025) -
One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning
por: Sun, Hao, et al.
Publicado: (2024) -
QuantTune: Optimizing Model Quantization with Adaptive Outlier-Driven Fine Tuning
por: Chen, Jiun-Man, et al.
Publicado: (2024)