Finding Visual Task Vectors
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hojel, Alberto, Bai, Yutong, Darrell, Trevor, Globerson, Amir, Bar, Amir |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision-Language Models Create Cross-Modal Task Representations
par: Luo, Grace, et autres
Publié: (2024)
par: Luo, Grace, et autres
Publié: (2024)
EgoPet: Egomotion and Interaction Data from an Animal's Perspective
par: Bar, Amir, et autres
Publié: (2024)
par: Bar, Amir, et autres
Publié: (2024)
Lifting Embodied World Models for Planning and Control
par: Wang, Alex N., et autres
Publié: (2026)
par: Wang, Alex N., et autres
Publié: (2026)
Vector Quantized Feature Fields for Fast 3D Semantic Lifting
par: Tang, George, et autres
Publié: (2025)
par: Tang, George, et autres
Publié: (2025)
Whole-Body Conditioned Egocentric Video Prediction
par: Bai, Yutong, et autres
Publié: (2025)
par: Bai, Yutong, et autres
Publié: (2025)
Stochastic positional embeddings improve masked image modeling
par: Bar, Amir, et autres
Publié: (2023)
par: Bar, Amir, et autres
Publié: (2023)
Navigation World Models
par: Bar, Amir, et autres
Publié: (2024)
par: Bar, Amir, et autres
Publié: (2024)
From Generated Human Videos to Physically Plausible Robot Trajectories
par: Ni, James, et autres
Publié: (2025)
par: Ni, James, et autres
Publié: (2025)
Analyzing The Language of Visual Tokens
par: Chan, David M., et autres
Publié: (2024)
par: Chan, David M., et autres
Publié: (2024)
PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs
par: Assouel, Rim, et autres
Publié: (2026)
par: Assouel, Rim, et autres
Publié: (2026)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024)
par: Huang, Brandon, et autres
Publié: (2024)
REOrdering Patches Improves Vision Models
par: Kutscher, Declan, et autres
Publié: (2025)
par: Kutscher, Declan, et autres
Publié: (2025)
Recursive Visual Programming
par: Ge, Jiaxin, et autres
Publié: (2023)
par: Ge, Jiaxin, et autres
Publié: (2023)
Latent Implicit Visual Reasoning
par: Li, Kelvin, et autres
Publié: (2025)
par: Li, Kelvin, et autres
Publié: (2025)
An Automated Tip-and-Cue Framework for Optimized Satellite Tasking and Visual Intelligence
par: Weissman, Gil, et autres
Publié: (2025)
par: Weissman, Gil, et autres
Publié: (2025)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts
par: Golovanevsky, Michal, et autres
Publié: (2025)
par: Golovanevsky, Michal, et autres
Publié: (2025)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
par: Lian, Long, et autres
Publié: (2023)
par: Lian, Long, et autres
Publié: (2023)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
par: Niu, Dantong, et autres
Publié: (2024)
par: Niu, Dantong, et autres
Publié: (2024)
From Audio to Photoreal Embodiment: Synthesizing Humans in Conversations
par: Ng, Evonne, et autres
Publié: (2024)
par: Ng, Evonne, et autres
Publié: (2024)
Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark
par: Wu, Tsung-Han, et autres
Publié: (2024)
par: Wu, Tsung-Han, et autres
Publié: (2024)
Scaling Language-Free Visual Representation Learning
par: Fan, David, et autres
Publié: (2025)
par: Fan, David, et autres
Publié: (2025)
Segment Anything without Supervision
par: Wang, XuDong, et autres
Publié: (2024)
par: Wang, XuDong, et autres
Publié: (2024)
When Do We Not Need Larger Vision Models?
par: Shi, Baifeng, et autres
Publié: (2024)
par: Shi, Baifeng, et autres
Publié: (2024)
DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding
par: Ahmadian, Mona, et autres
Publié: (2025)
par: Ahmadian, Mona, et autres
Publié: (2025)
A Dataset for Mechanical Mechanisms
par: Ghezelbash, Farshid, et autres
Publié: (2024)
par: Ghezelbash, Farshid, et autres
Publié: (2024)
Enriching Knowledge Distillation with Cross-Modal Teacher Fusion
par: Mansourian, Amir M., et autres
Publié: (2025)
par: Mansourian, Amir M., et autres
Publié: (2025)
Questioning the Stability of Visual Question Answering
par: Rosenfeld, Amir, et autres
Publié: (2025)
par: Rosenfeld, Amir, et autres
Publié: (2025)
Readout Guidance: Learning Control from Diffusion Features
par: Luo, Grace, et autres
Publié: (2023)
par: Luo, Grace, et autres
Publié: (2023)
Diffusion Hyperfeatures: Searching Through Time and Space for Semantic Correspondence
par: Luo, Grace, et autres
Publié: (2023)
par: Luo, Grace, et autres
Publié: (2023)
Visual Lexicon: Rich Image Features in Language Space
par: Wang, XuDong, et autres
Publié: (2024)
par: Wang, XuDong, et autres
Publié: (2024)
Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models
par: El-Ghoussani, Amir, et autres
Publié: (2026)
par: El-Ghoussani, Amir, et autres
Publié: (2026)
Solving Vision Tasks with Simple Photoreceptors Instead of Cameras
par: Atanov, Andrei, et autres
Publié: (2024)
par: Atanov, Andrei, et autres
Publié: (2024)
Visual Autoregressive Modelling for Monocular Depth Estimation
par: El-Ghoussani, Amir, et autres
Publié: (2025)
par: El-Ghoussani, Amir, et autres
Publié: (2025)
"I Know It When I See It": Mood Spaces for Connecting and Expressing Visual Concepts
par: Yang, Huzheng, et autres
Publié: (2025)
par: Yang, Huzheng, et autres
Publié: (2025)
Probing Multimodal Fusion in the Brain: The Dominance of Audiovisual Streams in Naturalistic Encoding
par: Abdollahi, Hamid, et autres
Publié: (2025)
par: Abdollahi, Hamid, et autres
Publié: (2025)
Vibe Spaces for Creatively Connecting and Expressing Visual Concepts
par: Yang, Huzheng, et autres
Publié: (2025)
par: Yang, Huzheng, et autres
Publié: (2025)
ZeroVO: Visual Odometry with Minimal Assumptions
par: Lai, Lei, et autres
Publié: (2025)
par: Lai, Lei, et autres
Publié: (2025)
Temporally Consistent Object Editing in Videos using Extended Attention
par: Zamani, AmirHossein, et autres
Publié: (2024)
par: Zamani, AmirHossein, et autres
Publié: (2024)
ViPer: Visual Personalization of Generative Models via Individual Preference Learning
par: Salehi, Sogand, et autres
Publié: (2024)
par: Salehi, Sogand, et autres
Publié: (2024)
Documents similaires
-
Vision-Language Models Create Cross-Modal Task Representations
par: Luo, Grace, et autres
Publié: (2024) -
EgoPet: Egomotion and Interaction Data from an Animal's Perspective
par: Bar, Amir, et autres
Publié: (2024) -
Lifting Embodied World Models for Planning and Control
par: Wang, Alex N., et autres
Publié: (2026) -
Vector Quantized Feature Fields for Fast 3D Semantic Lifting
par: Tang, George, et autres
Publié: (2025) -
Whole-Body Conditioned Egocentric Video Prediction
par: Bai, Yutong, et autres
Publié: (2025)