World Labs presenta Atlas, un modelo de mundo multimodal que genera, reconstruye y simula espacios en 3D

🕒 Publicado en Zendoric: 2 de septiembre de 2026 · 08:27
✨ Generado con IA · cómo se hace
World Labs, la compañía centrada en la llamada "inteligencia espacial", ha presentado Atlas, su nuevo modelo de mundo (world model) de próxima generación. Según la propia empresa, se trata de un modelo "omni" entrenado desde cero para operar de forma nativa sobre texto, imágenes, vídeo y datos 3D.
World Labs, la compañía centrada en la llamada "inteligencia espacial", ha presentado Atlas, su nuevo modelo de mundo (world model) de próxima generación. Según la propia empresa, se trata de un modelo "omni" entrenado desde cero para operar de forma nativa sobre texto, imágenes, vídeo y datos 3D. La idea central es que todas esas modalidades se combinan en un único "contexto espacial" compartido, a partir del cual el modelo genera lo que viene después, manteniendo la coherencia tridimensional con todo lo que ya ha visto e imaginando aquello que queda fuera de campo.
La promesa de fondo es la de un sistema capaz de cubrir tres frentes a la vez: generación de mundos imaginados para usos creativos, reconstrucción de escenas reales con alta fidelidad, y simulación de entornos para que los robots puedan planificar acciones. Según el artículo, Atlas alimentará futuras versiones de Marble y otros productos de la compañía.
En cuanto a arquitectura, la empresa describe Atlas como un "multimodal autoregressive diffusion transformer": un transformer que genera cada elemento de una secuencia multimodal de uno en uno (de forma autorregresiva, como un LLM), pero que produce esos elementos mediante difusión (concretamente, como un modelo de "rectified flow" que va eliminando ruido gradualmente, algo típico de los generadores de imagen y vídeo modernos). La novedad que subraya World Labs es que cada imagen o mapa de profundidad que entra o sale del modelo está anclado a una posición 3D explícita mediante una pose de cámara, lo que convierte ese contexto en algo espacial y no solo temporal o textual. Esto, afirman, permite un control de cámara mucho más preciso que las instrucciones de texto habituales en los modelos de vídeo, y abre posibilidades como colocar dos imágenes de referencia no relacionadas en el espacio 3D y pedir al modelo que genere un mundo que las conecte de forma coherente (pasillos, puertas, rincones intermedios, etc.).
En el terreno de las capacidades concretas, el artículo detalla cuatro grandes bloques. El primero es la generación con control de cámara: a partir de una o varias imágenes de referencia, Atlas genera vídeo con posiciones y ángulos de cámara definidos con precisión, llegando hasta un minuto de vídeo a resolución 1440p, y permitiendo diseñar trayectorias de cámara completas para producir "vídeos largos controlables" en los que, según la compañía, el usuario actúa como director de la escena en lugar de limitarse a lanzar generaciones al azar.
El segundo bloque es la reconstrucción espacial: Atlas puede reconstruir escenas reales a partir de entre una y decenas de imágenes, sin necesitar equipos de captura especializados. Cuantas más imágenes recibe, menos tiene que "imaginar" y más fiel es la reconstrucción; la empresa afirma que con apenas dos o tres imágenes ya iguala o supera a modelos especializados en reconstrucción 3D, y que puede aprovechar más de un centenar de imágenes de entrada para recrear entornos reales con fidelidad. El artículo ilustra esto con ejemplos como la reconstrucción progresiva de un jardín y una casa añadiendo imágenes una a una, o la recreación del Main Quad de Stanford a partir de entre dos y veinticinco fotos a pie de calle, generando incluso vistas aéreas del campus. Además de imágenes y vídeo en 2D, Atlas puede producir salidas 3D explícitas —nubes de puntos y "3D Gaussian splats"—, la misma representación que ya usa Marble, lo que facilita su integración en el resto de productos de la compañía.
El tercer bloque es la simulación espacio-temporal, donde Atlas actúa como simulador de mundo entendiendo tanto la estructura espacial como su evolución en el tiempo. Aquí destacan dos aplicaciones: el reencuadre de vídeo al estilo "bullet time" a partir de un puñado de cámaras corrientes (el artículo menciona que las grabaciones de demostración se hicieron con teléfonos móviles y cámaras de acción, sin equipo profesional), y la simulación para robótica mediante flujos de trabajo "Real-to-Sim": a partir de vídeos casuales grabados con móvil, Atlas ayuda a reconstruir un entorno y a la vez generar los datos RGB y de profundidad que "vería" un robot moviéndose por ese espacio, tanto para navegación como para manipulación de objetos, permitiendo variar objetos, posiciones, iluminación y fondo para generar datos de entrenamiento diversos.
El cuarto bloque, presentado como secundario respecto al objetivo principal del modelo, es la generación de imágenes: Atlas puede seguir instrucciones complejas, renderizar texto y generar panorámicas de 360 grados a partir de texto o imagen, con una variedad amplia de estilos visuales.
En cuanto a evaluación de rendimiento, World Labs presenta dos comparativas. En generación con control de cámara, comparan Atlas frente a varios modelos de vídeo (identificados en el artículo como MiniMax H3, Gemini Omni Flash, Happy Horse 1.1, FLUX 3 y Seedance 2.5), usando evaluadores humanos externos que juzgan qué modelo sigue mejor una trayectoria de cámara indicada. Según esos datos, Atlas fue preferido por entre el 75% y el 94% de los votantes dependiendo del modelo rival, con una ventaja que, afirman, crece cuanto más compleja es la trayectoria de cámara. Conviene señalar que la comparación usa control de cámara nativo para Atlas frente a descripciones en texto para los demás modelos, ya que estos no aceptan cámaras como entrada nativa; la propia empresa reconoce que un mejor "prompt engineering" podría mejorar los resultados de los rivales, aunque optaron por texto por ser la modalidad más habitual. En reconstrucción 3D a partir de vistas dispersas, Atlas se compara con modelos especializados de código abierto (Pi3X, π³, VGGT-Ω de 1B, Depth Anything 3 y MapAnything) sobre varios bancos de pruebas académicos (DTU, ETH3D, KITTI, NRGBD, 7-Scenes, T&T y ScanNet), mostrando un error medio relativo de punto más bajo que todos los modelos comparados, según cifras reproducidas por el propio equipo de World Labs bajo un protocolo de evaluación común.
Sobre el escalado, la compañía afirma haber entrenado una serie de modelos de tamaño y cómputo crecientes durante el desarrollo, y que cada nuevo nivel de cómputo desbloqueó nuevas capacidades, lo que les lleva a esperar que la tendencia se mantenga en futuros modelos.
De cara al lanzamiento, Atlas entra en fase de acceso anticipado ("early access") con socios seleccionados; quien quiera probarlo debe solicitar acceso a través del propio sitio de World Labs. La compañía también indica que está contratando personal de investigación e ingeniería. El artículo enlaza además, como contenido relacionado, una entrevista de Martin Casado (a16z) con Fei-Fei Li y Yunzhu Li sobre la adquisición de SceniX y el papel de la simulación en robótica, así como un texto sobre el enfoque "real-to-sim-to-real" para entrenar políticas de robots, ambos publicados por World Labs a finales de julio de 2026.
Conviene leer estas cifras con la cautela habitual en anuncios de producto: todos los benchmarks, comparativas y afirmaciones de superioridad proceden del propio equipo de World Labs, sin que el artículo mencione evaluación independiente más allá de los "raters humanos" externos empleados para el test de preferencia. Tampoco se detallan tamaños de modelo, volumen de datos de entrenamiento ni coste computacional, y el modelo aún no está disponible de forma pública, sino solo mediante solicitud de acceso anticipado. Dicho esto, el enfoque técnico —un transformer autorregresivo con difusión que ancla cada imagen a una pose de cámara en un contexto espacial compartido— resulta coherente con la tendencia más amplia de la industria hacia modelos que unifican generación de imagen, vídeo y reconstrucción 3D bajo una misma arquitectura, y encaja con el interés creciente por usar estos sistemas como motores de simulación para robótica.
🔗 Relacionadas en Zendoric
- Vint Cerf, 'padre de Internet', se retira de Google tras más de dos décadas · 2026-07-03
- Meta lanza Muse Image, su primer modelo de generación de imágenes de Meta Superintelligence Labs · 2026-07-09
- Moonshot presenta Kimi K3, el mayor modelo abierto del mundo, y China estrecha la brecha de IA con EE.UU. · 2026-07-18


