Enregistré dans:
| Auteurs principaux: | Rawal, Niyati, Bigazzi, Roberto, Baraldi, Lorenzo, Cucchiara, Rita |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2408.04423 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AIGeN: An Adversarial Approach for Instruction Generation in VLN
par: Rawal, Niyati, et autres
Publié: (2024)
par: Rawal, Niyati, et autres
Publié: (2024)
Personalized Instance-based Navigation Toward User-Specific Objects in Realistic Environments
par: Barsellotti, Luca, et autres
Publié: (2024)
par: Barsellotti, Luca, et autres
Publié: (2024)
Embodied Navigation at the Art Gallery
par: Bigazzi, Roberto, et autres
Publié: (2022)
par: Bigazzi, Roberto, et autres
Publié: (2022)
Explore and Explain: Self-supervised Navigation and Recounting
par: Bigazzi, Roberto, et autres
Publié: (2020)
par: Bigazzi, Roberto, et autres
Publié: (2020)
Mapping High-level Semantic Regions in Indoor Environments without Object Recognition
par: Bigazzi, Roberto, et autres
Publié: (2024)
par: Bigazzi, Roberto, et autres
Publié: (2024)
Embodied Agents for Efficient Exploration and Smart Scene Description
par: Bigazzi, Roberto, et autres
Publié: (2023)
par: Bigazzi, Roberto, et autres
Publié: (2023)
Spot the Difference: A Novel Task for Embodied Agents in Changing Environments
par: Landi, Federico, et autres
Publié: (2022)
par: Landi, Federico, et autres
Publié: (2022)
Autonomous Embodied Agents: When Robotics Meets Deep Learning Reasoning
par: Bigazzi, Roberto
Publié: (2025)
par: Bigazzi, Roberto
Publié: (2025)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
par: Baraldi, Lorenzo, et autres
Publié: (2023)
par: Baraldi, Lorenzo, et autres
Publié: (2023)
Optimizing Resource Consumption in Diffusion Models through Hallucination Early Detection
par: Betti, Federico, et autres
Publié: (2024)
par: Betti, Federico, et autres
Publié: (2024)
Hallucination Early Detection in Diffusion Models
par: Betti, Federico, et autres
Publié: (2026)
par: Betti, Federico, et autres
Publié: (2026)
Training-Free Open-Vocabulary Segmentation with Offline Diffusion-Augmented Prototype Generation
par: Barsellotti, Luca, et autres
Publié: (2024)
par: Barsellotti, Luca, et autres
Publié: (2024)
RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models
par: Mattioli, Gabriele, et autres
Publié: (2026)
par: Mattioli, Gabriele, et autres
Publié: (2026)
What Changed? Detecting and Evaluating Instruction-Guided Image Edits with Multimodal Large Language Models
par: Baraldi, Lorenzo, et autres
Publié: (2025)
par: Baraldi, Lorenzo, et autres
Publié: (2025)
Recurrence Meets Transformers for Universal Multimodal Retrieval
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
par: Bucciarelli, Davide, et autres
Publié: (2024)
par: Bucciarelli, Davide, et autres
Publié: (2024)
Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
Augmenting Multimodal LLMs with Self-Reflective Tokens for Knowledge-based Visual Question Answering
par: Cocchi, Federico, et autres
Publié: (2024)
par: Cocchi, Federico, et autres
Publié: (2024)
Parents and Children: Distinguishing Multimodal DeepFakes from Natural Images
par: Amoroso, Roberto, et autres
Publié: (2023)
par: Amoroso, Roberto, et autres
Publié: (2023)
Contrasting Deepfakes Diffusion via Contrastive Learning and Global-Local Similarities
par: Baraldi, Lorenzo, et autres
Publié: (2024)
par: Baraldi, Lorenzo, et autres
Publié: (2024)
Tiny Inference-Time Scaling with Latent Verifiers
par: Bucciarelli, Davide, et autres
Publié: (2026)
par: Bucciarelli, Davide, et autres
Publié: (2026)
Fluent and Accurate Image Captioning with a Self-Trained Reward Model
par: Moratelli, Nicholas, et autres
Publié: (2024)
par: Moratelli, Nicholas, et autres
Publié: (2024)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
The Revolution of Multimodal Large Language Models: A Survey
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries
par: Amoroso, Roberto, et autres
Publié: (2024)
par: Amoroso, Roberto, et autres
Publié: (2024)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Causal Graphical Models for Vision-Language Compositional Understanding
par: Parascandolo, Fiorenzo, et autres
Publié: (2024)
par: Parascandolo, Fiorenzo, et autres
Publié: (2024)
Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization
par: Moratelli, Nicholas, et autres
Publié: (2024)
par: Moratelli, Nicholas, et autres
Publié: (2024)
Hyperbolic Safety-Aware Vision-Language Models
par: Poppi, Tobia, et autres
Publié: (2025)
par: Poppi, Tobia, et autres
Publié: (2025)
Multi-Class Unlearning for Image Classification via Weight Filtering
par: Poppi, Samuele, et autres
Publié: (2023)
par: Poppi, Samuele, et autres
Publié: (2023)
Beyond Isolation: A Unified Benchmark for General-Purpose Navigation
par: Sun, Samson, et autres
Publié: (2026)
par: Sun, Samson, et autres
Publié: (2026)
WheelArm-Sim: A Manipulation and Navigation Combined Multimodal Synthetic Data Generation Simulator for Unified Control in Assistive Robotics
par: Liu, Guangping, et autres
Publié: (2026)
par: Liu, Guangping, et autres
Publié: (2026)
Trajectory Forecasting through Low-Rank Adaptation of Discrete Latent Codes
par: Benaglia, Riccardo, et autres
Publié: (2024)
par: Benaglia, Riccardo, et autres
Publié: (2024)
Resolving Positional Ambiguity in Dialogues by Vision-Language Models for Robot Navigation
par: Chen, Kuan-Lin, et autres
Publié: (2024)
par: Chen, Kuan-Lin, et autres
Publié: (2024)
Synthetic Data Generation for Bridging Sim2Real Gap in a Production Environment
par: Rawal, Parth, et autres
Publié: (2023)
par: Rawal, Parth, et autres
Publié: (2023)
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation
par: Zuo, Jing, et autres
Publié: (2026)
par: Zuo, Jing, et autres
Publié: (2026)
The Safety Challenge of World Models for Embodied AI Agents: A Review
par: Baraldi, Lorenzo, et autres
Publié: (2025)
par: Baraldi, Lorenzo, et autres
Publié: (2025)
Documents similaires
-
AIGeN: An Adversarial Approach for Instruction Generation in VLN
par: Rawal, Niyati, et autres
Publié: (2024) -
Personalized Instance-based Navigation Toward User-Specific Objects in Realistic Environments
par: Barsellotti, Luca, et autres
Publié: (2024) -
Embodied Navigation at the Art Gallery
par: Bigazzi, Roberto, et autres
Publié: (2022) -
Explore and Explain: Self-supervised Navigation and Recounting
par: Bigazzi, Roberto, et autres
Publié: (2020) -
Mapping High-level Semantic Regions in Indoor Environments without Object Recognition
par: Bigazzi, Roberto, et autres
Publié: (2024)