LISAT: Language-Instructed Segmentation Assistant for Satellite Imagery
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Quenum, Jerome, Hsieh, Wen-Han, Wu, Tsung-Han, Gupta, Ritwik, Darrell, Trevor, Chan, David M. |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Do What? Teaching Vision-Language-Action Models to Reject the Impossible
par: Hsieh, Wen-Han, et autres
Publié: (2025)
par: Hsieh, Wen-Han, et autres
Publié: (2025)
Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark
par: Wu, Tsung-Han, et autres
Publié: (2024)
par: Wu, Tsung-Han, et autres
Publié: (2024)
REOrdering Patches Improves Vision Models
par: Kutscher, Declan, et autres
Publié: (2025)
par: Kutscher, Declan, et autres
Publié: (2025)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
par: Lee, Heekyung, et autres
Publié: (2025)
par: Lee, Heekyung, et autres
Publié: (2025)
Enough Coin Flips Can Make LLMs Act Bayesian
par: Gupta, Ritwik, et autres
Publié: (2025)
par: Gupta, Ritwik, et autres
Publié: (2025)
xT: Nested Tokenization for Larger Context in Large Images
par: Gupta, Ritwik, et autres
Publié: (2024)
par: Gupta, Ritwik, et autres
Publié: (2024)
LITA: Language Instructed Temporal-Localization Assistant
par: Huang, De-An, et autres
Publié: (2024)
par: Huang, De-An, et autres
Publié: (2024)
Seg the HAB: Language-Guided Geospatial Algae Bloom Reasoning and Segmentation
par: Hsieh, Patterson, et autres
Publié: (2025)
par: Hsieh, Patterson, et autres
Publié: (2025)
Data-Centric AI Governance: Addressing the Limitations of Model-Focused Policies
par: Gupta, Ritwik, et autres
Publié: (2024)
par: Gupta, Ritwik, et autres
Publié: (2024)
UnSAMv2: Self-Supervised Learning Enables Segment Anything at Any Granularity
par: Yu, Junwei, et autres
Publié: (2025)
par: Yu, Junwei, et autres
Publié: (2025)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
par: Wu, Tsung-Han, et autres
Publié: (2024)
par: Wu, Tsung-Han, et autres
Publié: (2024)
Analyzing The Language of Visual Tokens
par: Chan, David M., et autres
Publié: (2024)
par: Chan, David M., et autres
Publié: (2024)
Optimizing TD3 for 7-DOF Robotic Arm Grasping: Overcoming Suboptimality with Exploration-Enhanced Contrastive Learning
par: Hsieh, Wen-Han, et autres
Publié: (2024)
par: Hsieh, Wen-Han, et autres
Publié: (2024)
Position Prediction Self-Supervised Learning for Multimodal Satellite Imagery Semantic Segmentation
par: Waithaka, John, et autres
Publié: (2025)
par: Waithaka, John, et autres
Publié: (2025)
Readable Minds: Emergent Theory-of-Mind-Like Behavior in LLM Poker Agents
par: Lin, Hsieh-Ting, et autres
Publié: (2026)
par: Lin, Hsieh-Ting, et autres
Publié: (2026)
SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning
par: Wu, Xue, et autres
Publié: (2026)
par: Wu, Xue, et autres
Publié: (2026)
VisLingInstruct: Elevating Zero-Shot Learning in Multi-Modal Language Models with Autonomous Instruction Optimization
par: Zhu, Dongsheng, et autres
Publié: (2024)
par: Zhu, Dongsheng, et autres
Publié: (2024)
VibeCheck: Discover and Quantify Qualitative Differences in Large Language Models
par: Dunlap, Lisa, et autres
Publié: (2024)
par: Dunlap, Lisa, et autres
Publié: (2024)
InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing
par: Lin, Kun-Hsiang, et autres
Publié: (2025)
par: Lin, Kun-Hsiang, et autres
Publié: (2025)
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
Multimodal Chip Physical Design Engineer Assistant
par: Tsai, Yun-Da, et autres
Publié: (2025)
par: Tsai, Yun-Da, et autres
Publié: (2025)
Segment Anything for Satellite Imagery: A Strong Baseline and a Regional Dataset for Automatic Field Delineation
par: Scribano, Carmelo, et autres
Publié: (2025)
par: Scribano, Carmelo, et autres
Publié: (2025)
InstructMol: Multi-Modal Integration for Building a Versatile and Reliable Molecular Assistant in Drug Discovery
par: Cao, He, et autres
Publié: (2023)
par: Cao, He, et autres
Publié: (2023)
Navigating the Labyrinth: Evaluating LLMs' Ability to Reason About Search Problems
par: Borazjanizadeh, Nasim, et autres
Publié: (2024)
par: Borazjanizadeh, Nasim, et autres
Publié: (2024)
Whack-a-Chip: The Futility of Hardware-Centric Export Controls
par: Gupta, Ritwik, et autres
Publié: (2024)
par: Gupta, Ritwik, et autres
Publié: (2024)
Artificial Intelligence in Traffic Systems
par: Saxena, Ritwik Raj
Publié: (2024)
par: Saxena, Ritwik Raj
Publié: (2024)
IGraSS: Learning to Identify Infrastructure Networks from Satellite Imagery by Iterative Graph-constrained Semantic Segmentation
par: Hoque, Oishee Bintey, et autres
Publié: (2025)
par: Hoque, Oishee Bintey, et autres
Publié: (2025)
Bootstrapping Rare Object Detection in High-Resolution Satellite Imagery
par: Zaytar, Akram, et autres
Publié: (2024)
par: Zaytar, Akram, et autres
Publié: (2024)
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
par: Zhen, Haoyu, et autres
Publié: (2026)
par: Zhen, Haoyu, et autres
Publié: (2026)
Hyperbolic Active Learning for Semantic Segmentation under Domain Shift
par: Franco, Luca, et autres
Publié: (2023)
par: Franco, Luca, et autres
Publié: (2023)
InsTraj: Instructing Diffusion Models with Travel Intentions to Generate Real-world Trajectories
par: Zhu, Yuanshao, et autres
Publié: (2026)
par: Zhu, Yuanshao, et autres
Publié: (2026)
UniAPL: A Unified Adversarial Preference Learning Framework for Instruct-Following
par: Qian, FaQiang, et autres
Publié: (2025)
par: Qian, FaQiang, et autres
Publié: (2025)
DiffusionSat: A Generative Foundation Model for Satellite Imagery
par: Khanna, Samar, et autres
Publié: (2023)
par: Khanna, Samar, et autres
Publié: (2023)
BackSlash: Rate Constrained Optimized Training of Large Language Models
par: Wu, Jun, et autres
Publié: (2025)
par: Wu, Jun, et autres
Publié: (2025)
SegLLM: Multi-round Reasoning Segmentation
par: Wang, XuDong, et autres
Publié: (2024)
par: Wang, XuDong, et autres
Publié: (2024)
Deep Learning for Pavement Condition Evaluation Using Satellite Imagery
par: Lebaku, Prathyush Kumar Reddy, et autres
Publié: (2025)
par: Lebaku, Prathyush Kumar Reddy, et autres
Publié: (2025)
SatSwinMAE: Efficient Autoencoding for Multiscale Time-series Satellite Imagery
par: Nakayama, Yohei, et autres
Publié: (2024)
par: Nakayama, Yohei, et autres
Publié: (2024)
PartInstruct: Part-level Instruction Following for Fine-grained Robot Manipulation
par: Yin, Yifan, et autres
Publié: (2025)
par: Yin, Yifan, et autres
Publié: (2025)
How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning
par: Kim, Bosung, et autres
Publié: (2026)
par: Kim, Bosung, et autres
Publié: (2026)
Vocabulary-Free 3D Instance Segmentation with Vision and Language Assistant
par: Mei, Guofeng, et autres
Publié: (2024)
par: Mei, Guofeng, et autres
Publié: (2024)
Documents similaires
-
Do What? Teaching Vision-Language-Action Models to Reject the Impossible
par: Hsieh, Wen-Han, et autres
Publié: (2025) -
Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark
par: Wu, Tsung-Han, et autres
Publié: (2024) -
REOrdering Patches Improves Vision Models
par: Kutscher, Declan, et autres
Publié: (2025) -
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
par: Lee, Heekyung, et autres
Publié: (2025) -
Enough Coin Flips Can Make LLMs Act Bayesian
par: Gupta, Ritwik, et autres
Publié: (2025)