GEO AI
Novedades en herramientas y modelos de IA en ArcGIS (segundo trimestre de 2026)
Por Alexandra Wynn
Las herramientas, modelos y servicios impulsados por inteligencia artificial (IA) que aceleran la creación, extracción y análisis de datos en ArcGIS continúan expandiéndose, a medida que las organizaciones buscan incorporar la IA en sus flujos de trabajo cotidianos de Sistemas de Información Geográfica. Esta actualización presenta las incorporaciones y mejoras más recientes, con un enfoque especial en cómo los modelos fundacionales (Foundation Models) y los embeddings están definiendo la siguiente etapa de la inteligencia artificial geoespacial (GeoAI).
De modelos específicos para tareas a modelos fundacionales: la evolución de la IA en ArcGIS
ArcGIS ofrece actualmente más de 100 modelos de inteligencia artificial preentrenados que ayudan a las organizaciones a automatizar soluciones para desafíos geoespaciales del mundo real. Estos modelos pueden utilizarse inmediatamente, sin necesidad de entrenamiento adicional, y están disponibles fácilmente a través de ArcGIS Living Atlas. Esri continúa ampliando su biblioteca de modelos especializados para tareas concretas y regiones específicas, al mismo tiempo que incorpora directamente en ArcGIS modelos fundacionales, tanto de código abierto como desarrollados por la propia Esri. Para comprender lo que esto significa en la práctica, es importante conocer el papel que desempeñan estos modelos.
Los modelos fundacionales se entrenan con conjuntos de datos masivos y muy diversos, lo que permite que un mismo modelo pueda realizar una amplia variedad de tareas de análisis. Esto brinda a los profesionales SIG una mayor flexibilidad para resolver problemas sin necesidad de ajustar modelos existentes o desarrollar nuevos modelos desde cero. Dependiendo del tipo de datos, estos modelos pueden emplearse para tareas como: detección de objetos, extracción de entidades geográficas, clasificación de píxeles, predicción, pronóstico y análisis de cambios. Por ejemplo, el modelo Text SAM permite identificar y extraer elementos de imágenes mediante instrucciones escritas en lenguaje natural (prompts), en lugar de requerir largos procesos de entrenamiento. Esto hace que la aplicación de la inteligencia artificial en los flujos de trabajo diarios sea mucho más rápida y accesible, incluso para usuarios sin conocimientos especializados en IA.
Desde julio de 2025, ArcGIS Living Atlas ha incorporado varios modelos fundacionales de código abierto desarrollados por la comunidad, enfocados específicamente en datos geoespaciales. Uno de ellos es Clay (Large), un modelo entrenado con imágenes de percepción remota que es capaz de comprender el contexto espacial y los patrones presentes en los datos. Esto facilita numerosas tareas analíticas, especialmente en áreas como: monitoreo ambiental, análisis urbano y análisis del territorio. Al integrar estos modelos fundacionales en ArcGIS, Esri ayuda a las organizaciones a acelerar la adopción de la inteligencia artificial, reducir la necesidad de entrenar modelos propios y obtener información valiosa de los datos geoespaciales de una manera más eficiente.
Presentación de los modelos fundacionales desarrollados por Esri
Además de integrar modelos fundacionales creados por la comunidad, Esri también está desarrollando sus propios modelos con el objetivo de ayudar a los usuarios a obtener mayor valor de sus datos con un menor esfuerzo. Uno de estos nuevos modelos es Global Location Encoder (Sentinel-2), este modelo fundacional está diseñado para comprender la relación existente entre las imágenes satelitales y las coordenadas geográficas. Fue entrenado utilizando imágenes Sentinel-2 Nivel 2 correspondientes al año 2024, distribuidas globalmente y aprovechando la mayoría de las bandas espectrales disponibles. Gracias a ello, el modelo captura características ambientales y físicas asociadas con ubicaciones de todo el planeta. El Global Location Encoder puede acelerar numerosos flujos de trabajo analíticos, entre ellos: clasificación, regresión, detección de cambios, búsqueda por similitud y análisis de imágenes con reconocimiento del contexto geográfico.
Otro de los modelos fundacionales desarrollados por Esri que destaca es el Geospatial Vision Language Model (GeoVLM). GeoVLM lleva la adaptabilidad de los modelos fundacionales un paso más allá al conectar las imágenes de percepción remota con el lenguaje natural. Esto permite que los usuarios extraigan entidades SIG o describan escenas presentes en una imagen mediante instrucciones sencillas (prompts), como: “Segment roads" (Segmentar carreteras) o "Describe the region" (Describir la región).
A diferencia de muchos modelos de visión y lenguaje diseñados para usos generales, GeoVLM fue creado específicamente para flujos de trabajo geoespaciales y puede realizar múltiples tareas, entre ellas: detección de objetos, clasificación de píxeles, conteo de objetos, respuesta a preguntas (Question Answering), generación automática de descripciones de imágenes (Image Captioning) y clasificación de escenas. Diseñado específicamente para imágenes de percepción remota, GeoVLM fue entrenado con millones de pares de imágenes y descripciones provenientes tanto de conjuntos de datos desarrollados por Esri como de fuentes de código abierto que abarcan distintas regiones del mundo. Gracias a su vocabulario abierto (Open Vocabulary), el modelo puede identificar una gran variedad de objetos y elementos geográficos sin haber sido entrenado explícitamente para reconocer cada uno de ellos.
Además, permite su implementación local (Local Deployment), lo que significa que las organizaciones pueden ejecutar el modelo dentro de su propia infraestructura sin depender de servicios de IA alojados en la nube. GeoVLM estará disponible inicialmente mediante una beta privada para un grupo limitado de usuarios. Las personas interesadas en probarlo y proporcionar retroalimentación podrán registrarse para recibir acceso cuando comiencen las pruebas.
Descubriendo patrones ocultos mediante geospatial embeddings
A medida que los modelos fundacionales amplían la cantidad de tareas que un solo modelo puede realizar, surge una pregunta importante: ¿Cómo consiguen representar tipos de datos geoespaciales tan diversos y ser útiles para tantas aplicaciones distintas? La solución consiste en convertir los datos de entrada sin procesar en embeddings, o números que conservan el significado y la relación dentro de los datos en un formato que los modelos de IA puedan utilizar.
En el ámbito geoespacial, los embeddings pueden entenderse como un conjunto de características aprendidas automáticamente que representan la esencia de un lugar.
Posteriormente, estos embeddings pueden utilizarse en distintos procesos analíticos, por ejemplo: encontrar lugares similares, realizar predicciones, detectar patrones espaciales, identificar relaciones entre diferentes ubicaciones. Esto facilita descubrir tendencias y áreas de interés que serían difíciles de detectar utilizando únicamente los datos originales. Por ejemplo, una empresa podría localizar nuevos sitios ideales para abrir sucursales buscando zonas cuyo perfil geodemográfico sea similar al de sus establecimientos con mejor desempeño.
En términos generales, existen dos tipos de embeddings geoespaciales: embeddings de ubicación e embeddings de imágenes. Los embeddings de ubicación representan las características clave de los lugares, capturando señales relacionadas con la demografía, la economía, el medio ambiente y otros factores geográficos. Los embeddings de imágenes capturan los patrones visuales y el significado semántico dentro de las imágenes, como si un área es "boscosa", "urbana" o "desértica". Ofrecen un valor único porque ayudan a convertir las imágenes en un conjunto de datos listo para el análisis con el que los modelos de IA pueden trabajar a gran escala, lo que hace que el análisis avanzado de imágenes sea más accesible para los profesionales de SIG.
Conjunto de herramientas de análisis basado en embeddings
ArcGIS Pro 3.7 incorpora nuevas herramientas que permiten generar y trabajar con embeddings tanto en imágenes como en conjuntos de datos vectoriales.
Genere Embeddings utilizando modelos de IA: Esta herramienta crea embeddings utilizando modelos fundacionales. Además del Global Location Encoder, existen varios modelos fundacionales nuevos de código abierto disponibles para utilizar con esta herramienta en análisis de imágenes y búsqueda por similitud, como Prithvi EO 2.0, Clay, TerraMind, DOFA y DINOv2. Estos modelos pueden accederse a través de los paquetes de Deep Learning de ArcGIS Living Atlas.
Encuentra características similares usando Embeddings: Esta herramienta te ayuda a encontrar entidades similares dentro de datos geoespaciales, incluso cuando esas similitudes son sutiles o difíciles de definir utilizando únicamente los atributos originales. Funciona comparando los embeddings de diferentes ubicaciones para identificar cuáles son las más similares. Por ejemplo, después de identificar un área dañada en una imagen posterior a un desastre, puede utilizar esta herramienta para encontrar automáticamente otras áreas con patrones de daño similares dentro de una gran colección de imágenes.
Combinar Embeddings: Esta herramienta agrega embeddings de una capa de origen en una capa de polígonos de destino de mayor tamaño, lo que le permite resumir información compleja en áreas geográficas más amplias. Por ejemplo, puede agregar embeddings generados a nivel de código postal al nivel de condado.
Comienza a utilizar modelos fundacionales y embeddings en ArcGIS
Comienza a utilizar modelos fundacionales y embeddings en ArcGISArcGIS está incorporando el poder de los modelos fundacionales y los embeddings a los flujos de trabajo diarios de los Sistemas de Información Geográfica, ayudando a las organizaciones a analizar datos con mayor rapidez, descubrir patrones ocultos y resolver problemas espaciales complejos con menos esfuerzo.
- Para acceder a los modelos fundacionales de código abierto y desarrollados por Esri, visita Deep Learning Packages en ArcGIS Living Atlas.
- Obten más información sobre los embeddings en SIG en este artículo y aprende cómo generar y utilizar embeddings con el conjunto de herramientas de Análisis basado en Embeddings- en la documentación de ArcGIS Pro.
Alexandra Wynn
Alexandra es Product Marketing Manager del equipo de Imagery & Remote Sensing en Esri. Actualmente trabaja en la transformación de la estrategia de análisis de imágenes de Esri para productos como ArcGIS Image Analyst, ArcGIS Excalibur, así como para funcionalidades como GeoAI y las capacidades ráster disponibles en toda la plataforma ArcGIS. Antes de incorporarse a Esri, Alexandra se especializó en estrategias de CRM, marketing de contenidos y marketing por correo electrónico para importantes empresas del sector tecnológico.