Recursive Visual Programming
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ge, Jiaxin, Subramanian, Sanjay, Shi, Baifeng, Herzig, Roei, Darrell, Trevor |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
par: Shang, Chuyi, et autres
Publié: (2024)
par: Shang, Chuyi, et autres
Publié: (2024)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
Latent Implicit Visual Reasoning
par: Li, Kelvin, et autres
Publié: (2025)
par: Li, Kelvin, et autres
Publié: (2025)
LLM-grounded Video Diffusion Models
par: Lian, Long, et autres
Publié: (2023)
par: Lian, Long, et autres
Publié: (2023)
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024)
par: Huang, Brandon, et autres
Publié: (2024)
AutoPresent: Designing Structured Visuals from Scratch
par: Ge, Jiaxin, et autres
Publié: (2025)
par: Ge, Jiaxin, et autres
Publié: (2025)
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
par: Niu, Dantong, et autres
Publié: (2024)
par: Niu, Dantong, et autres
Publié: (2024)
Pose Priors from Language Models
par: Subramanian, Sanjay, et autres
Publié: (2024)
par: Subramanian, Sanjay, et autres
Publié: (2024)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
par: Mitra, Chancharik, et autres
Publié: (2025)
par: Mitra, Chancharik, et autres
Publié: (2025)
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
par: Huang, Brandon, et autres
Publié: (2025)
par: Huang, Brandon, et autres
Publié: (2025)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
par: Mitra, Chancharik, et autres
Publié: (2024)
par: Mitra, Chancharik, et autres
Publié: (2024)
When Do We Not Need Larger Vision Models?
par: Shi, Baifeng, et autres
Publié: (2024)
par: Shi, Baifeng, et autres
Publié: (2024)
TULIP: Towards Unified Language-Image Pretraining
par: Tang, Zineng, et autres
Publié: (2025)
par: Tang, Zineng, et autres
Publié: (2025)
Learning to Grasp Anything by Playing with Random Toys
par: Niu, Dantong, et autres
Publié: (2025)
par: Niu, Dantong, et autres
Publié: (2025)
From Generated Human Videos to Physically Plausible Robot Trajectories
par: Ni, James, et autres
Publié: (2025)
par: Ni, James, et autres
Publié: (2025)
Vision-Language Models Create Cross-Modal Task Representations
par: Luo, Grace, et autres
Publié: (2024)
par: Luo, Grace, et autres
Publié: (2024)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
par: Lee, Heekyung, et autres
Publié: (2025)
par: Lee, Heekyung, et autres
Publié: (2025)
Dual-Process Image Generation
par: Luo, Grace, et autres
Publié: (2025)
par: Luo, Grace, et autres
Publié: (2025)
Analyzing The Language of Visual Tokens
par: Chan, David M., et autres
Publié: (2024)
par: Chan, David M., et autres
Publié: (2024)
Two Causal Principles for Improving Visual Dialog
par: Qi, Jiaxin, et autres
Publié: (2019)
par: Qi, Jiaxin, et autres
Publié: (2019)
Rethinking Patch Dependence for Masked Autoencoders
par: Fu, Letian, et autres
Publié: (2024)
par: Fu, Letian, et autres
Publié: (2024)
Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models
par: Girrbach, Leander, et autres
Publié: (2025)
par: Girrbach, Leander, et autres
Publié: (2025)
Visual Program Distillation with Template-Based Augmentation
par: Shlapentokh-Rothman, Michal, et autres
Publié: (2024)
par: Shlapentokh-Rothman, Michal, et autres
Publié: (2024)
Finding Visual Task Vectors
par: Hojel, Alberto, et autres
Publié: (2024)
par: Hojel, Alberto, et autres
Publié: (2024)
VDebugger: Harnessing Execution Feedback for Debugging Visual Programs
par: Wu, Xueqing, et autres
Publié: (2024)
par: Wu, Xueqing, et autres
Publié: (2024)
Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
par: Wu, Tsung-Han, et autres
Publié: (2025)
par: Wu, Tsung-Han, et autres
Publié: (2025)
Humanoid Locomotion as Next Token Prediction
par: Radosavovic, Ilija, et autres
Publié: (2024)
par: Radosavovic, Ilija, et autres
Publié: (2024)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
par: Qin, Yiming, et autres
Publié: (2025)
par: Qin, Yiming, et autres
Publié: (2025)
Activation Reward Models for Few-Shot Model Alignment
par: Chai, Tianning, et autres
Publié: (2025)
par: Chai, Tianning, et autres
Publié: (2025)
FoundationMotion: Auto-Labeling and Reasoning about Spatial Movement in Videos
par: Gan, Yulu, et autres
Publié: (2025)
par: Gan, Yulu, et autres
Publié: (2025)
Scaling Vision Pre-Training to 4K Resolution
par: Shi, Baifeng, et autres
Publié: (2025)
par: Shi, Baifeng, et autres
Publié: (2025)
A Review on Large Language Models for Visual Analytics
par: Agarwal, Navya Sonal, et autres
Publié: (2025)
par: Agarwal, Navya Sonal, et autres
Publié: (2025)
Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding
par: Mitra, Chancharik, et autres
Publié: (2023)
par: Mitra, Chancharik, et autres
Publié: (2023)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
par: Xu, Zhiyang, et autres
Publié: (2024)
par: Xu, Zhiyang, et autres
Publié: (2024)
Visual Program Distillation: Distilling Tools and Programmatic Reasoning into Vision-Language Models
par: Hu, Yushi, et autres
Publié: (2023)
par: Hu, Yushi, et autres
Publié: (2023)
VisionPangu: A Compact and Fine-Grained Multimodal Assistant with 1.7B Parameters
par: Fan, Jiaxin, et autres
Publié: (2026)
par: Fan, Jiaxin, et autres
Publié: (2026)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
ConMe: Rethinking Evaluation of Compositional Reasoning for Modern VLMs
par: Huang, Irene, et autres
Publié: (2024)
par: Huang, Irene, et autres
Publié: (2024)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
par: Hannan, Tanveer, et autres
Publié: (2024)
par: Hannan, Tanveer, et autres
Publié: (2024)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
par: Hu, Yushi, et autres
Publié: (2024)
par: Hu, Yushi, et autres
Publié: (2024)
Documents similaires
-
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
par: Shang, Chuyi, et autres
Publié: (2024) -
Compositional Chain-of-Thought Prompting for Large Multimodal Models
par: Mitra, Chancharik, et autres
Publié: (2023) -
Latent Implicit Visual Reasoning
par: Li, Kelvin, et autres
Publié: (2025) -
LLM-grounded Video Diffusion Models
par: Lian, Long, et autres
Publié: (2023) -
Multimodal Task Vectors Enable Many-Shot Multimodal In-Context Learning
par: Huang, Brandon, et autres
Publié: (2024)