PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Wahed, Muntasir, Nguyen, Kiet A., Juvekar, Adheesh Sunil, Li, Xinzhuo, Zhou, Xiaona, Shah, Vedant, Yu, Tianjiao, Yanardag, Pinar, Lourentzou, Ismini |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models
by: Nguyen, Kiet A., et al.
Published: (2024)
by: Nguyen, Kiet A., et al.
Published: (2024)
Uncertainty in Action: Confidence Elicitation in Embodied Agents
by: Yu, Tianjiao, et al.
Published: (2025)
by: Yu, Tianjiao, et al.
Published: (2025)
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
by: Li, Xinzhuo, et al.
Published: (2025)
by: Li, Xinzhuo, et al.
Published: (2025)
Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection
by: Zhou, Xiaona, et al.
Published: (2026)
by: Zhou, Xiaona, et al.
Published: (2026)
Part$^{2}$GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
by: Yu, Tianjiao, et al.
Published: (2025)
by: Yu, Tianjiao, et al.
Published: (2025)
MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?
by: Wahed, Muntasir, et al.
Published: (2025)
by: Wahed, Muntasir, et al.
Published: (2025)
RewardFlow: Generate Images by Optimizing What You Reward
by: Susladkar, Onkar, et al.
Published: (2026)
by: Susladkar, Onkar, et al.
Published: (2026)
DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising
by: Yu, Tianjiao, et al.
Published: (2026)
by: Yu, Tianjiao, et al.
Published: (2026)
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
by: Susladkar, Onkar, et al.
Published: (2026)
by: Susladkar, Onkar, et al.
Published: (2026)
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
by: Yu, Tianjiao, et al.
Published: (2025)
by: Yu, Tianjiao, et al.
Published: (2025)
RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance
by: Venkatesh, Kavana, et al.
Published: (2024)
by: Venkatesh, Kavana, et al.
Published: (2024)
PurpCode: Reasoning for Safer Code Generation
by: Liu, Jiawei, et al.
Published: (2025)
by: Liu, Jiawei, et al.
Published: (2025)
Best of Both Worlds: Multimodal Reasoning and Generation via Unified Discrete Flow Matching
by: Susladkar, Onkar, et al.
Published: (2026)
by: Susladkar, Onkar, et al.
Published: (2026)
mTSBench: Benchmarking Multivariate Time Series Anomaly Detection and Model Selection at Scale
by: Zhou, Xiaona, et al.
Published: (2025)
by: Zhou, Xiaona, et al.
Published: (2025)
Hierarchical Dataset Selection for High-Quality Data Sharing
by: Zhou, Xiaona, et al.
Published: (2025)
by: Zhou, Xiaona, et al.
Published: (2025)
Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics
by: Shen, Ying, et al.
Published: (2026)
by: Shen, Ying, et al.
Published: (2026)
Commonsense for Zero-Shot Natural Language Video Localization
by: Holla, Meghana, et al.
Published: (2023)
by: Holla, Meghana, et al.
Published: (2023)
CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
by: Venkatesh, Kavana, et al.
Published: (2025)
by: Venkatesh, Kavana, et al.
Published: (2025)
3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding
by: Ogunleye, Makanjuola, et al.
Published: (2026)
by: Ogunleye, Makanjuola, et al.
Published: (2026)
LoRAShop: Training-Free Multi-Concept Image Generation and Editing with Rectified Flow Transformers
by: Dalva, Yusuf, et al.
Published: (2025)
by: Dalva, Yusuf, et al.
Published: (2025)
GANTASTIC: GAN-based Transfer of Interpretable Directions for Disentangled Image Editing in Text-to-Image Diffusion Models
by: Dalva, Yusuf, et al.
Published: (2024)
by: Dalva, Yusuf, et al.
Published: (2024)
MMPlanner: Zero-Shot Multimodal Procedural Planning with Chain-of-Thought Object State Reasoning
by: Tabassum, Afrina, et al.
Published: (2025)
by: Tabassum, Afrina, et al.
Published: (2025)
EgoForge: Goal-Directed Egocentric World Simulator
by: Shen, Yifan, et al.
Published: (2026)
by: Shen, Yifan, et al.
Published: (2026)
Dynamic View Synthesis as an Inverse Problem
by: Yesiltepe, Hidir, et al.
Published: (2025)
by: Yesiltepe, Hidir, et al.
Published: (2025)
From Zero to Hero: Training-Free Custom Concept Spawning in World Models
by: Akdemir, Kiymet, et al.
Published: (2026)
by: Akdemir, Kiymet, et al.
Published: (2026)
ORACLE: Leveraging Mutual Information for Consistent Character Generation with LoRAs in Diffusion Models
by: Akdemir, Kiymet, et al.
Published: (2024)
by: Akdemir, Kiymet, et al.
Published: (2024)
AdaState: Self-Evolving Anchors for Streaming Video Generation
by: Dalva, Yusuf, et al.
Published: (2026)
by: Dalva, Yusuf, et al.
Published: (2026)
Audit & Repair: An Agentic Framework for Consistent Story Visualization in Text-to-Image Diffusion Models
by: Akdemir, Kiymet, et al.
Published: (2025)
by: Akdemir, Kiymet, et al.
Published: (2025)
Explaining in Diffusion: Explaining a Classifier Through Hierarchical Semantics with Text-to-Image Diffusion Models
by: Kazimi, Tahira, et al.
Published: (2024)
by: Kazimi, Tahira, et al.
Published: (2024)
MIST: Mitigating Intersectional Bias with Disentangled Cross-Attention Editing in Text-to-Image Diffusion Models
by: Yesiltepe, Hidir, et al.
Published: (2024)
by: Yesiltepe, Hidir, et al.
Published: (2024)
The Curious Case of End Token: A Zero-Shot Disentangled Image Editing using CLIP
by: Yesiltepe, Hidir, et al.
Published: (2024)
by: Yesiltepe, Hidir, et al.
Published: (2024)
FAIR: Facilitating Artificial Intelligence Resilience in Manufacturing Industrial Internet
by: Zeng, Yingyan, et al.
Published: (2025)
by: Zeng, Yingyan, et al.
Published: (2025)
ELBA: Learning by Asking for Embodied Visual Navigation and Task Completion
by: Shen, Ying, et al.
Published: (2023)
by: Shen, Ying, et al.
Published: (2023)
Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
by: Dunlop, Connor, et al.
Published: (2025)
by: Dunlop, Connor, et al.
Published: (2025)
Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization
by: Kazimi, Tahira, et al.
Published: (2025)
by: Kazimi, Tahira, et al.
Published: (2025)
LoRAverse: A Submodular Framework to Retrieve Diverse Adapters for Diffusion Models
by: Sonmezer, Mert, et al.
Published: (2025)
by: Sonmezer, Mert, et al.
Published: (2025)
FluxSpace: Disentangled Semantic Editing in Rectified Flow Transformers
by: Dalva, Yusuf, et al.
Published: (2024)
by: Dalva, Yusuf, et al.
Published: (2024)
PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation
by: Liu, Yuanzhe, et al.
Published: (2026)
by: Liu, Yuanzhe, et al.
Published: (2026)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
by: Tabassum, Afrina, et al.
Published: (2024)
by: Tabassum, Afrina, et al.
Published: (2024)
Contrastive Test-Time Composition of Multiple LoRA Models for Image Generation
by: Meral, Tuna Han Salih, et al.
Published: (2024)
by: Meral, Tuna Han Salih, et al.
Published: (2024)
Similar Items
-
CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models
by: Nguyen, Kiet A., et al.
Published: (2024) -
Uncertainty in Action: Confidence Elicitation in Embodied Agents
by: Yu, Tianjiao, et al.
Published: (2025) -
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
by: Li, Xinzhuo, et al.
Published: (2025) -
Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection
by: Zhou, Xiaona, et al.
Published: (2026) -
Part$^{2}$GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
by: Yu, Tianjiao, et al.
Published: (2025)