Enregistré dans:
| Auteurs principaux: | Ott, Joachim, Wang, Zuowen, Liu, Shih-Chii |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.03439 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025)
par: Tu, Songjun, et autres
Publié: (2025)
Analyzing Quality, Bias, and Performance in Text-to-Image Generative Models
par: Masrourisaadat, Nila, et autres
Publié: (2024)
par: Masrourisaadat, Nila, et autres
Publié: (2024)
OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment
par: Zhao, Weiyi, et autres
Publié: (2025)
par: Zhao, Weiyi, et autres
Publié: (2025)
TensLoRA: Tensor Alternatives for Low-Rank Adaptation
par: Marmoret, Axel, et autres
Publié: (2025)
par: Marmoret, Axel, et autres
Publié: (2025)
Deterministic Event-Graph Substrates as World Models for Counterfactual Reasoning
par: Rovai, Fabio
Publié: (2026)
par: Rovai, Fabio
Publié: (2026)
WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents
par: Liu, Bingnan, et autres
Publié: (2026)
par: Liu, Bingnan, et autres
Publié: (2026)
SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving
par: Bajpai, Ashutosh, et autres
Publié: (2026)
par: Bajpai, Ashutosh, et autres
Publié: (2026)
Aligning by Misaligning: Boundary-aware Curriculum Learning for Multimodal Alignment
par: Ye, Hua, et autres
Publié: (2025)
par: Ye, Hua, et autres
Publié: (2025)
Clarification as Supervision: Reinforcement Learning for Vision-Language Interfaces
par: Gkountouras, John, et autres
Publié: (2025)
par: Gkountouras, John, et autres
Publié: (2025)
The MSR-Video to Text Dataset with Clean Annotations
par: Chen, Haoran, et autres
Publié: (2021)
par: Chen, Haoran, et autres
Publié: (2021)
A Survey on Vision-Language-Action Models for Embodied AI
par: Ma, Yueen, et autres
Publié: (2024)
par: Ma, Yueen, et autres
Publié: (2024)
Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models
par: Wang, Guoyan, et autres
Publié: (2025)
par: Wang, Guoyan, et autres
Publié: (2025)
HuMoCon: Concept Discovery for Human Motion Understanding
par: Fang, Qihang, et autres
Publié: (2025)
par: Fang, Qihang, et autres
Publié: (2025)
Learning the meanings of function words from grounded language using a visual question answering model
par: Portelance, Eva, et autres
Publié: (2023)
par: Portelance, Eva, et autres
Publié: (2023)
Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
par: Yang, Shan
Publié: (2026)
par: Yang, Shan
Publié: (2026)
Hateful Meme Detection through Context-Sensitive Prompting and Fine-Grained Labeling
par: Ouyang, Rongxin, et autres
Publié: (2024)
par: Ouyang, Rongxin, et autres
Publié: (2024)
ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing
par: Bucher, Martin JJ., et autres
Publié: (2025)
par: Bucher, Martin JJ., et autres
Publié: (2025)
Unpacking Hateful Memes: Presupposed Context and False Claims
par: Cai, Weibin, et autres
Publié: (2025)
par: Cai, Weibin, et autres
Publié: (2025)
VGA: Vision GUI Assistant -- Minimizing Hallucinations through Image-Centric Fine-Tuning
par: Meng, Ziyang, et autres
Publié: (2024)
par: Meng, Ziyang, et autres
Publié: (2024)
VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
par: Liao, Xinyao, et autres
Publié: (2025)
par: Liao, Xinyao, et autres
Publié: (2025)
CaLoRAify: Calorie Estimation with Visual-Text Pairing and LoRA-Driven Visual Language Models
par: Yao, Dongyu, et autres
Publié: (2024)
par: Yao, Dongyu, et autres
Publié: (2024)
Survey Transfer Learning: Recycling Data with Silicon Responses
par: Amini, Ali
Publié: (2025)
par: Amini, Ali
Publié: (2025)
GLoT: A Novel Gated-Logarithmic Transformer for Efficient Sign Language Translation
par: Shahin, Nada, et autres
Publié: (2025)
par: Shahin, Nada, et autres
Publié: (2025)
Training a Student Expert via Semi-Supervised Foundation Model Distillation
par: Taghavi, Pardis, et autres
Publié: (2026)
par: Taghavi, Pardis, et autres
Publié: (2026)
Spatially Optimized Compact Deep Metric Learning Model for Similarity Search
par: Islam, Md. Farhadul, et autres
Publié: (2024)
par: Islam, Md. Farhadul, et autres
Publié: (2024)
Exploring the Capabilities of Large Language Model Encoders for Image-Text Retrieval in Chest X-rays
par: Ko, Hanbin, et autres
Publié: (2025)
par: Ko, Hanbin, et autres
Publié: (2025)
Semantically Guided Adversarial Testing of Vision Models Using Language Models
par: Filus, Katarzyna, et autres
Publié: (2025)
par: Filus, Katarzyna, et autres
Publié: (2025)
Training for X-Ray Vision: Amodal Segmentation, Amodal Content Completion, and View-Invariant Object Representation from Multi-Camera Video
par: Moore, Alexander, et autres
Publié: (2025)
par: Moore, Alexander, et autres
Publié: (2025)
Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
par: Bajpai, Ashutosh, et autres
Publié: (2026)
par: Bajpai, Ashutosh, et autres
Publié: (2026)
CulinaryCut-VLAP: A Vision-Language-Action-Physics Framework for Food Cutting via a Force-Aware Material Point Method
par: Koh, Hyunseo, et autres
Publié: (2026)
par: Koh, Hyunseo, et autres
Publié: (2026)
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images
par: Koukounas, Andreas, et autres
Publié: (2024)
par: Koukounas, Andreas, et autres
Publié: (2024)
A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection
par: Malikussaid, et autres
Publié: (2026)
par: Malikussaid, et autres
Publié: (2026)
Autoassociative Learning of Structural Representations for Modeling and Classification in Medical Imaging
par: Buchnajzer, Zuzanna, et autres
Publié: (2024)
par: Buchnajzer, Zuzanna, et autres
Publié: (2024)
ADAT: Time-Series-Aware Adaptive Transformer Architecture for Sign Language Translation
par: Shahin, Nada, et autres
Publié: (2025)
par: Shahin, Nada, et autres
Publié: (2025)
VALSE: A Task-Independent Benchmark for Vision and Language Models Centered on Linguistic Phenomena
par: Parcalabescu, Letitia, et autres
Publié: (2021)
par: Parcalabescu, Letitia, et autres
Publié: (2021)
MM-SHAP: A Performance-agnostic Metric for Measuring Multimodal Contributions in Vision and Language Models & Tasks
par: Parcalabescu, Letitia, et autres
Publié: (2022)
par: Parcalabescu, Letitia, et autres
Publié: (2022)
VLA Foundry: A Unified Framework for Training Vision-Language-Action Models
par: Mercat, Jean, et autres
Publié: (2026)
par: Mercat, Jean, et autres
Publié: (2026)
eStonefish-Scenes: A Sim-to-Real Validated and Robot-Centric Event-based Optical Flow Dataset for Underwater Vehicles
par: Mansour, Jad, et autres
Publié: (2025)
par: Mansour, Jad, et autres
Publié: (2025)
Optimized Gradient Clipping for Noisy Label Learning
par: Ye, Xichen, et autres
Publié: (2024)
par: Ye, Xichen, et autres
Publié: (2024)
Biomedical Visual Instruction Tuning with Clinician Preference Alignment
par: Cui, Hejie, et autres
Publié: (2024)
par: Cui, Hejie, et autres
Publié: (2024)
Documents similaires
-
Perception-Consistency Multimodal Large Language Models Reasoning via Caption-Regularized Policy Optimization
par: Tu, Songjun, et autres
Publié: (2025) -
Analyzing Quality, Bias, and Performance in Text-to-Image Generative Models
par: Masrourisaadat, Nila, et autres
Publié: (2024) -
OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment
par: Zhao, Weiyi, et autres
Publié: (2025) -
TensLoRA: Tensor Alternatives for Low-Rank Adaptation
par: Marmoret, Axel, et autres
Publié: (2025) -
Deterministic Event-Graph Substrates as World Models for Counterfactual Reasoning
par: Rovai, Fabio
Publié: (2026)