ByDeWay: Boost Your multimodal LLM with DEpth prompting in a Training-Free Way
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Roy, Rajarshi, Das, Devleena, Banerjee, Ankesh, Bhattacharjee, Arjya, Dasgupta, Kousik, Tripathi, Subarna |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
par: Bu, Jiazi, et autres
Publié: (2024)
par: Bu, Jiazi, et autres
Publié: (2024)
Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search
par: Liu, Sainan, et autres
Publié: (2026)
par: Liu, Sainan, et autres
Publié: (2026)
VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
par: Dipta, Shubhashis Roy, et autres
Publié: (2025)
par: Dipta, Shubhashis Roy, et autres
Publié: (2025)
PALADIN : Robust Neural Fingerprinting for Text-to-Image Diffusion Models
par: L, Murthy, et autres
Publié: (2025)
par: L, Murthy, et autres
Publié: (2025)
Waver: Wave Your Way to Lifelike Video Generation
par: Zhang, Yifu, et autres
Publié: (2025)
par: Zhang, Yifu, et autres
Publié: (2025)
VideoSAGE: Video Summarization with Graph Representation Learning
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
Customize Your Own Paired Data via Few-shot Way
par: Chen, Jinshu, et autres
Publié: (2024)
par: Chen, Jinshu, et autres
Publié: (2024)
Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models
par: Wu, Tz-Ying, et autres
Publié: (2025)
par: Wu, Tz-Ying, et autres
Publié: (2025)
Harnessing Object Grounding for Time-Sensitive Video Understanding
par: Wu, Tz-Ying, et autres
Publié: (2025)
par: Wu, Tz-Ying, et autres
Publié: (2025)
SViTT-Ego: A Sparse Video-Text Transformer for Egocentric Video
par: Valdez, Hector A., et autres
Publié: (2024)
par: Valdez, Hector A., et autres
Publié: (2024)
Keystep Recognition using Graph Neural Networks
par: Romero, Julia Lee, et autres
Publié: (2025)
par: Romero, Julia Lee, et autres
Publié: (2025)
Contrastive Language Video Time Pre-training
par: Liu, Hengyue, et autres
Publié: (2024)
par: Liu, Hengyue, et autres
Publié: (2024)
Graph-Based Multimodal and Multi-view Alignment for Keystep Recognition
par: Romero, Julia Lee, et autres
Publié: (2025)
par: Romero, Julia Lee, et autres
Publié: (2025)
Generating customized prompts for Zero-Shot Rare Event Medical Image Classification using LLM
par: Kamboj, Payal, et autres
Publié: (2025)
par: Kamboj, Payal, et autres
Publié: (2025)
Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization
par: Su, Weijian, et autres
Publié: (2026)
par: Su, Weijian, et autres
Publié: (2026)
TrajPred: Trajectory-Conditioned Joint Embedding Prediction for Surgical Instrument-Tissue Interaction Recognition in Vision-Language Models
par: Cheng, Jiajun, et autres
Publié: (2026)
par: Cheng, Jiajun, et autres
Publié: (2026)
Ego-VPA: Egocentric Video Understanding with Parameter-efficient Adaptation
par: Wu, Tz-Ying, et autres
Publié: (2024)
par: Wu, Tz-Ying, et autres
Publié: (2024)
SlimDiff: Training-Free, Activation-Guided Hands-free Slimming of Diffusion Models
par: Roy, Arani, et autres
Publié: (2025)
par: Roy, Arani, et autres
Publié: (2025)
AR Overlay: Training Image Pose Estimation on Curved Surface in a Synthetic Way
par: Huang, Sining, et autres
Publié: (2024)
par: Huang, Sining, et autres
Publié: (2024)
bi-modal textual prompt learning for vision-language models in remote sensing
par: Kashyap, Pankhi, et autres
Publié: (2026)
par: Kashyap, Pankhi, et autres
Publié: (2026)
Seeing a Rose in Five Thousand Ways
par: Zhang, Yunzhi, et autres
Publié: (2022)
par: Zhang, Yunzhi, et autres
Publié: (2022)
Fast-SmartWay: Panoramic-Free End-to-End Zero-Shot Vision-and-Language Navigation
par: Shi, Xiangyu, et autres
Publié: (2025)
par: Shi, Xiangyu, et autres
Publié: (2025)
Feature-prompting GBMSeg: One-Shot Reference Guided Training-Free Prompt Engineering for Glomerular Basement Membrane Segmentation
par: Liu, Xueyu, et autres
Publié: (2024)
par: Liu, Xueyu, et autres
Publié: (2024)
HDR Reconstruction Boosting with Training-Free and Exposure-Consistent Diffusion
par: Lin, Yo-Tin, et autres
Publié: (2026)
par: Lin, Yo-Tin, et autres
Publié: (2026)
KAN or MLP? Point Cloud Shows the Way Forward
par: Shi, Yan, et autres
Publié: (2025)
par: Shi, Yan, et autres
Publié: (2025)
How to Design and Train Your Implicit Neural Representation for Video Compression
par: Gwilliam, Matthew, et autres
Publié: (2025)
par: Gwilliam, Matthew, et autres
Publié: (2025)
NOVO: Unlearning-Compliant Vision Transformers
par: Roy, Soumya, et autres
Publié: (2025)
par: Roy, Soumya, et autres
Publié: (2025)
Pay Attention to Your Neighbours: Training-Free Open-Vocabulary Semantic Segmentation
par: Hajimiri, Sina, et autres
Publié: (2024)
par: Hajimiri, Sina, et autres
Publié: (2024)
FrogDogNet: Fourier frequency Retained visual prompt Output Guidance for Domain Generalization of CLIP in Remote Sensing
par: Gunduboina, Hariseetharam, et autres
Publié: (2025)
par: Gunduboina, Hariseetharam, et autres
Publié: (2025)
Are We on the Right Way for Evaluating Large Vision-Language Models?
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
ITACLIP: Boosting Training-Free Semantic Segmentation with Image, Text, and Architectural Enhancements
par: Aydın, M. Arda, et autres
Publié: (2024)
par: Aydın, M. Arda, et autres
Publié: (2024)
The Way Up: A Dataset for Hold Usage Detection in Sport Climbing
par: Maschek, Anna, et autres
Publié: (2025)
par: Maschek, Anna, et autres
Publié: (2025)
BenchDepth: Are We on the Right Way to Evaluate Depth Foundation Models?
par: Li, Zhenyu, et autres
Publié: (2025)
par: Li, Zhenyu, et autres
Publié: (2025)
Imagine with the Teacher: Complete Shape in a Multi-View Distillation Way
par: Luo, Zhanpeng, et autres
Publié: (2025)
par: Luo, Zhanpeng, et autres
Publié: (2025)
DSNet: A Novel Way to Use Atrous Convolutions in Semantic Segmentation
par: Guo, Zilu, et autres
Publié: (2024)
par: Guo, Zilu, et autres
Publié: (2024)
Just Project! Multi-Channel Despeckling, the Easy Way
par: Denis, Loïc, et autres
Publié: (2024)
par: Denis, Loïc, et autres
Publié: (2024)
Training-Free Semantic Segmentation via LLM-Supervision
par: Sun, Wenfang, et autres
Publié: (2024)
par: Sun, Wenfang, et autres
Publié: (2024)
EASG-Bench: Video Q&A Benchmark with Egocentric Action Scene Graphs
par: Rodin, Ivan, et autres
Publié: (2025)
par: Rodin, Ivan, et autres
Publié: (2025)
Training-Free Personalization via Retrieval and Reasoning on Fingerprints
par: Das, Deepayan, et autres
Publié: (2025)
par: Das, Deepayan, et autres
Publié: (2025)
Semantic-Guided Two-Stage GAN for Face Inpainting with Hybrid Perceptual Encoding
par: Bhattacharya, Abhigyan, et autres
Publié: (2025)
par: Bhattacharya, Abhigyan, et autres
Publié: (2025)
Documents similaires
-
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
par: Bu, Jiazi, et autres
Publié: (2024) -
Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search
par: Liu, Sainan, et autres
Publié: (2026) -
VC-Inspector: Advancing Reference-free Evaluation of Video Captions with Factual Analysis
par: Dipta, Shubhashis Roy, et autres
Publié: (2025) -
PALADIN : Robust Neural Fingerprinting for Text-to-Image Diffusion Models
par: L, Murthy, et autres
Publié: (2025) -
Waver: Wave Your Way to Lifelike Video Generation
par: Zhang, Yifu, et autres
Publié: (2025)