theme-sticky-logo-alt

Controlando Blender con Lenguaje Natural a través de Claude Code mediante el Model Context Protocol (MCP) de Anthropic – Inteligencia Artificial

Desde hace un tiempo me ha llamado mucho la atención cómo los modelos de lenguaje basados en Inteligencia Artificial (IA) están dejando de ser simples “chatbots que responden texto” para convertirse en algo más cercano a agentes que pueden interactuar directamente con aplicaciones. Esa curiosidad me llevó a investigar un protocolo relativamente nuevo llamado Model Context Protocol (MCP), y los resultados de esa investigación acaban de publicarse como capítulo de libro en el Handbook T-II Inclusión y Tecnología en la Educación Superior: Perspectivas Interdisciplinarias desde la UNACAR.

Me gustaría contarles de qué va este trabajo, qué descubrimos y por qué creo que es relevante para cualquier persona interesada en Inteligencia Artificial y diseño 3D.

¿DE QUÉ TRATA LA INVESTIGACIÓN?

El capítulo de libro se titula “Integración de agentes de inteligencia artificial basados en LLM con Entornos 3D mediante el Model Context Protocol [MCP]: Caso Claude-Blender” y lo escribí junto con Benjamín Tass-Herrera, Gustavo Verduzco-Reyes y José Gabriel Reding-Domínguez, todos colegas de la Universidad Autónoma del Carmen.

La idea central fue poner a prueba qué tan bien funciona MCP como puente entre un modelo de lenguaje (Claude) y una herramienta de modelado 3D (Blender). Es decir, ¿puede un agente de IA recibir instrucciones escritas en español y ejecutar acciones concretas dentro de Blender? ¿Y qué tan eficiente es ese proceso?

¿QUÉ ES MCP Y POR QUÉ IMPORTA?

Para entender el contexto, cabe señalar que los modelos de lenguaje como Claude o ChatGPT tradicionalmente funcionan de una forma bastante limitada: tú les escribes algo, ellos te responden generalmente con texto, y ahí termina la interacción. No tienen forma de “tocar” otras aplicaciones.

MCP cambia eso. Es un protocolo abierto que publicó Anthropic en noviembre de 2024, y funciona como una especie de puerto USB entre el modelo de lenguaje y aplicaciones externas. Gracias a MCP, Claude puede conectarse a otras aplicaciones, en este caso en particular con Blender, recibir información sobre el estado actual de la escena 3D, ejecutar acciones (crear objetos, aplicar materiales, animar) y confirmar los resultados. Todo en tiempo real y mediante lenguaje natural.

Funcionamiento de MCP ejemplificado con Blender

Esto resuelve un problema real conocido como el problema M×N: si tienes M modelos de IA y N herramientas, normalmente necesitarías construir M×N integraciones diferentes. MCP propone un estándar único, por lo que cualquier modelo compatible puede comunicarse con cualquier herramienta que implemente el protocolo.

¿CÓMO PUSIMOS A PRUEBA MCP CON BLENDER?

Configuramos un entorno donde Claude Desktop (usando Claude 3.7 Sonnet) se conectó a Blender 4.2 mediante un complemento llamado BlenderMCP. Todo corriendo en la misma máquina con Windows 11.

Diseñamos 10 escenarios de prueba con tres niveles de complejidad:

  • Complejidad baja (5 tareas): crear primitivas básicas, escalarlas, aplicar materiales, duplicar objetos y rotarlos. Son instrucciones directas y concretas.
  • Complejidad media (3 tareas): agrupar objetos en colecciones, crear animaciones, descargar texturas desde PolyHaven y configurar iluminación HDRI. Aquí las instrucciones ya implican varios pasos encadenados.
  • Complejidad alta (2 tareas): modelar una escena completa a partir de una imagen de referencia, y modelar una nave espacial detallada con múltiples componentes a partir de un solo prompt largo.

Para medir qué tan bien le fue al agente, propusimos una métrica propia que llamamos Eficiencia Contextual, que combina tres factores: la precisión en la ejecución (¿hizo lo que le pedí?), la complejidad de la tarea (¿cuántos pasos requirió?) y la latencia (¿cuánto tiempo tardó?).

¿Y QUÉ RESULTADOS OBTUVIMOS?

Aquí es donde se pone interesante. En las tareas de complejidad baja, Claude respondió con una precisión perfecta y tiempos bastante cortos. Creó objetos, les puso nombres descriptivos por su cuenta (como “Cubo_Origen” o “Esfera_Azul”), aplicó materiales y ejecutó transformaciones sin problema. La eficiencia contextual en estos casos superó consistentemente el umbral de referencia.

En complejidad media los resultados seguían siendo buenos, aunque se notaron algunos puntos: cuando Claude tenía que conectarse a servicios externos como PolyHaven para descargar texturas o HDRIs, la latencia aumentaba considerablemente. También encontramos que las instrucciones ambiguas generan problemas; por ejemplo, al pedir “configura iluminación HDRI en la escena”, Claude la aplicó solo a un objeto en vez de a toda la escena.

Donde la cosa se complicó fue en complejidad alta. Cuando le pedimos que modelara una casa a partir de una imagen de referencia, generó únicamente la estructura base con elementos flotando en el espacio y sin detalles como ventanas o puertas. Y cuando le pedimos realizar una nave espacial detallada (con alas, láseres, misiles, cabina de piloto y bandera de México), el resultado fue un conjunto de piezas dispersas con texturas aplicadas parcialmente. La eficiencia cayó a valores cercanos a cero.

La lección aquí es clara: un prompt largo y complejo no sustituye un flujo de trabajo paso a paso. Al menos no con la tecnología actual de MCP/Claude.

¿QUÉ SIGNIFICA ESTO?

Es importante recalcar que este trabajo no pretende presentar a MCP como una herramienta lista para producción profesional en 3D. Lo que sí demuestra es que la dirección es correcta. La estandarización de la comunicación entre modelos de lenguaje y software especializado abre posibilidades que van mucho más allá de Blender: editores de video, motores de videojuegos, herramientas de diseño industrial, control robótico, por mencionar algunos.

MCP todavía es un estándar joven (fue publicado a finales de 2024), por lo que es natural que tenga limitaciones en flujos de trabajo complejos. Pero los resultados en tareas de complejidad baja y media son bastante prometedores, y a medida que los modelos de lenguaje mejoren su capacidad de razonamiento y los servidores MCP maduren, el panorama va a cambiar.

LEE EL CAPÍTULO DE LIBRO COMPLETO

Si te interesa conocer la metodología a detalle, revisar la fórmula de Eficiencia Contextual, ver los datos de cada escenario o consultar las referencias del trabajo, te invito a leer el capítulo completo:

Guerra-Guerrero, C. O., Tass-Herrera, B., Verduzco-Reyes, G. y Reding-Domínguez, J. G. (2025). Integración de agentes de inteligencia artificial basados en LLM con Entornos 3D mediante el Model Context Protocol [MCP]: Caso Claude-Blender. En Handbook T-II Inclusión y Tecnología en la Educación Superior (pp. 78-88). ECORFAN.

Disponible SIN COSTO en: https://doi.org/10.35429/H.2025.2.78.88

Comentarios
ARTÍCULO ANTERIOR
Como Reemplazar Imágenes Rotas en React colocando una imagen por defecto (placeholder) – fallback images on error
15 49.0138 8.38624 1 0 4000 1 https://www.cesarguerra.mx 300 0