Entrada de imágenes en Foundation Models en iOS 27
iOS 26 le dio a una app un modelo de lenguaje grande en el dispositivo que leía texto y escribía texto. iOS 27 le entrega a ese mismo modelo un par de ojos. En la WWDC26, Apple confirmó que el modelo de lenguaje del sistema en el dispositivo «también está adquiriendo capacidades Vision, lo que abre categorías enteras de nuevas aplicaciones»1, y la forma de alcanzar esas capacidades resulta casi anticlimática: pones una imagen en el prompt junto a las palabras, como adjunto, y haces tu pregunta. Sin un pipeline de visión aparte, sin cambiar de modelo, sin un nuevo tipo de sesión. El prompt que antes llevaba una cadena de texto ahora también lleva una imagen, y el modelo responde sobre ambas.
Por qué la pequeña superficie de la API es lo destacable: la entrada de imágenes no es una API satélite atornillada a Foundation Models. Apple la describe como «una extensión natural de los prompt builders existentes»1, lo que significa que cada concepto que ya aprendiste en iOS 26 (las sesiones, la generación guiada, el protocolo Tool) sigue funcionando sin cambios en el momento en que un prompt se vuelve multimodal4. Si todavía no conoces LanguageModelSession, empieza por la explicación del framework Foundation Models y luego vuelve.
TL;DR
- El modelo en el dispositivo de iOS 27 acepta entrada de imágenes. Insertas un adjunto de imagen en tu prompt junto al texto, y el modelo responde preguntas sobre la imagen12.
- Los adjuntos de imagen se pueden crear a partir de una variedad de tipos:
UIImage,NSImage,CGImage, tipos de Core Image, pixel buffers de CoreVideo y URL de archivos1. - El modelo admite imágenes de cualquier tamaño y relación de aspecto, así que no necesitas recortar ni rellenar para lograr una forma concreta; eso sí, las imágenes más grandes consumen más tokens e implican más latencia1.
- Foundation Models le da al LLM una amplia versatilidad sobre una imagen; el framework Vision ofrece un análisis fijo, rápido y finamente ajustado. La recomendación de Apple es combinarlos mediante llamadas a herramientas en lugar de elegir2.
- El modelo de servidor de Private Cloud Compute también admite entrada de imágenes, con una ventana de contexto de 32K (frente a 4K en el dispositivo), de modo que los prompts multimodales que cargan texto más varias imágenes tienen espacio para respirar3.
Qué cambió: el prompt ganó una imagen
En la sesión 241, el planteamiento de Apple es preciso. El modelo en el dispositivo «es más inteligente; mejor en lógica y en llamadas a herramientas», y sobre esa inteligencia ahora gana Vision1. La demostración le pregunta al modelo por una foto de origami: «Simplemente inserta un adjunto de imagen en tu prompt, junto con texto. Ahora el modelo puede responder preguntas sobre la imagen»1. El orden importa. El texto y la imagen viven en el mismo prompt, el modelo lee el prompt completo y la respuesta razona sobre ambos.
El conjunto de tipos de origen es lo bastante amplio como para que rara vez tengas que convertir algo tú mismo. Apple enumera seis: los adjuntos de imagen «se pueden crear a partir de una variedad de tipos, entre ellos UIImage, NSImage, CGImage, tipos de Core Image, pixel buffers de CoreVideo y URL de archivos»1. Una UIImage recién salida de PhotosPicker, una CGImage que ya renderizaste, un fotograma que sacaste de la cámara como CVPixelBuffer o un archivo en disco mediante URL: todos se convierten en entrada válida. La transcripción nombra los tipos de entrada, pero no las firmas exactas de los inicializadores del adjunto, así que trata la lista de tipos como el contrato y deja que el autocompletado de Xcode rellene el punto de llamada una vez que estés en el SDK de iOS 27.
Hay una restricción contra la que no tienes que pelear: la forma. «El modelo admite imágenes de cualquier tamaño y relación de aspecto, así que no necesitas recortar ni rellenar para lograr una forma concreta»1. Un recibo alargado, un panorama ancho y una miniatura cuadrada son todos aceptables tal cual. El costo es el que cabría esperar de cualquier modelo con presupuesto de tokens: «Se permiten tamaños de imagen arbitrarios, pero ten en cuenta que las imágenes más grandes consumirán más tokens e implicarán más latencia»1. Una imagen no es contexto gratis. Gasta del mismo presupuesto que tu texto, lo cual es la primera decisión de diseño que el multimodal te impone, y la razón por la que el tamaño del contexto (que se trata más abajo) pasa a ser determinante.
Como la entrada de imágenes va sobre el prompt builder existente, toda la maquinaria de iOS 26 sigue intacta. La generación guiada todavía moldea la salida en un tipo @Generable. El protocolo Tool todavía permite que el modelo llame a tu código. El streaming sigue transmitiendo. El modelo ganó un sentido, no un nuevo modelo de programación.
La conexión con la comprensión de imágenes: Foundation Models y Vision no son rivales
La sesión 237, «Novedades de la comprensión de imágenes», es donde Apple traza la línea entre las dos maneras de analizar una imagen, y la distinción es lo más útil de cualquiera de las dos charlas para decidir qué construir. La apertura es reveladora: a la presentadora se le extravía la agenda, fotografía sus notas adhesivas y le pide «a un modelo de lenguaje grande que genere una agenda. Esto es bastante fácil de hacer con el framework Foundation Models. Por suerte, este año Foundation Models admite entradas de imagen»2. Ese es todo el argumento de la vertiente descriptiva del multimodal: poner subtítulos a imágenes, sugerir mejoras de decoración a partir de la foto de una habitación, generar una receta a partir de la foto de un refrigerador. El veredicto de la presentadora sobre dónde brilla el LLM: «Los modelos suelen rendir bien en tareas descriptivas»2.
Luego llega la comparación honesta. «El framework Foundation Models aprovecha modelos de lenguaje grandes, que pueden hacer casi cualquier cosa que les pidas. En comparación, los frameworks tradicionales de procesamiento de imágenes, como Vision, usan un conjunto fijo de APIs de visión por computadora. Las APIs de Vision están finamente ajustadas para tareas específicas, que realizan muy bien. Y Vision es rápida. A menudo lo bastante rápida como para analizar fotogramas de video en tiempo real»2. Léelo como una regla de enrutamiento. ¿Una pregunta abierta sobre una imagen fija, en la que quieres lenguaje de vuelta? Foundation Models. ¿Una tarea específica y bien definida a la velocidad de los fotogramas de video (detección de rostros, postura, saliencia, segmentación)? Vision. El LLM es un generalista que piensa; la API de Vision es un especialista que ejecuta.
El remate de Apple es que no tienes por qué elegir: «no siempre tienes que elegir entre Vision y Foundation Models para analizar tus imágenes. Hay una manera de aprovechar la experiencia de Vision junto con la versatilidad de Foundation Model usando llamadas a herramientas»2. Las llamadas a herramientas de iOS 27 ahora admiten argumentos de imagen. Cuando un modelo no puede identificar algo por sí mismo (la charla usa la identificación de plantas), llama a una herramienta y, «en lugar de pasar la imagen completa como argumento, el modelo pasa una referencia a la imagen»2. Esa referencia, una ImageReference, «debe ser una referencia a una imagen existente de la sesión de chat actual»2, que la herramienta resuelve de vuelta en un adjunto a través del historial de la sesión, lista para analizar. El bucle de control y las OCRTool y BarcodeReaderTool integradas son el tema del artículo complementario, el control de las llamadas a herramientas en iOS 27; aquí el punto es más acotado: la entrada de imágenes y las herramientas con argumento de imagen son dos capas de la misma pila multimodal, y se componen entre sí.
Multimodal en Private Cloud Compute: el mismo prompt, más espacio
LanguageModelSession y resume aprovechando el contexto de 32K que ofrece PCC.
La sesión 319 abre confirmando de golpe las dos mitades de la historia multimodal. El modelo en el dispositivo «ahora tiene soporte para entrada de imágenes, sigue mejor las instrucciones y llama a tus herramientas personalizadas»3, y para los casos más pesados hay un nuevo modelo de servidor en Private Cloud Compute. La razón por la que multimodal y PCC pertenecen a la misma conversación es el tamaño del contexto. Apple lo expresa con cifras claras: «El modelo en el dispositivo ofrece 4k, y con PCC obtienes 32K»3. Una imagen gasta tokens de ese presupuesto1, así que un prompt que carga texto más varias imágenes es justo el tipo de payload que tensiona los 4K y cabe cómodamente en 32K.
La demostración del resumidor hace concreto ese encaje. «Aquí tengo una app que resume un artículo usando el modelo de PCC. Puedo seleccionar un archivo markdown, y tomamos el texto y las imágenes, los pasamos a una LanguageModelSession y generamos un resumen. Esto funciona de maravilla con el gran tamaño de contexto que ofrece PCC»3. Texto e imágenes, una sesión, un prompt. El costo de migrar del dispositivo al servidor es una línea: Apple muestra que «cambiando tan solo 1 línea de código, puedes pasar al nuevo modelo de servidor en PCC»3, porque «el framework Foundation Models ofrece una API unificada de Swift, sin importar con qué modelo estés hablando»3. La generación guiada con Generable y las llamadas a herramientas «funcionan exactamente igual con el modelo de PCC que con el modelo en el dispositivo»3.
PCC añade razonamiento, del que el modelo en el dispositivo carece, y el razonamiento tiene un costo relevante para el multimodal: «el razonamiento es texto extra que el modelo genera. Así que usa tokens. Esto cuenta para tu límite de tamaño de contexto»3. Empareja un razonamiento profundo con varias imágenes a plena resolución en un mismo prompt y estarás gastando el presupuesto de 32K por ambos extremos. Los detalles más finos (los tres niveles de razonamiento, el manejo del límite diario con quotaUsage e isLimitReached, el entitlement que solicitas en el sitio para desarrolladores) corresponden al análisis a fondo de Private Cloud Compute; la conclusión multimodal es que el mismo prompt con imágenes corre en ambos modelos, y que el modelo de servidor existe para cuando el prompt supera la capacidad del dispositivo.
Cómo adoptar la entrada de imágenes
Una lista breve que se desprende de los contratos anteriores.
Empieza en el dispositivo, mide y luego decide. El propio consejo de Apple es elegir el modelo «con base en datos, no solo en intuiciones»3, y advierte que «puede sorprenderte lo bien que rinde el modelo en el dispositivo en ciertas tareas, sobre todo con el modelo actualizado de este año»3. Un subtítulo o una consulta del tipo «qué es este objeto» quizá nunca necesite PCC. Recurre al modelo de servidor cuando el prompt cargue varias imágenes o un texto largo que rebase la ventana de 4K del dispositivo3.
Elige el tipo de origen más barato para tu pipeline. Puedes entregarle al modelo una UIImage, una NSImage, una CGImage, un tipo de Core Image, un CVPixelBuffer o una URL de archivo1. Si un fotograma ya existe como pixel buffer de la cámara o como archivo en disco, pásalo directamente en vez de dar un rodeo por UIImage.
Trata la resolución de la imagen como una perilla de presupuesto, no como un dial de calidad. Cualquier tamaño y relación de aspecto es legal1, así que resiste el recorte excesivo por la forma. Pero como las imágenes más grandes cuestan más tokens y más latencia1, reduce una foto de 48 megapíxeles antes de que entre en un prompt cuando la tarea (leer este letrero, qué habitación es esta) no necesita cada píxel.
Enruta por tarea, no por reflejo. El trabajo descriptivo, abierto, con salida en lenguaje va a Foundation Models; el trabajo de visión por computadora fijo, rápido y en tiempo real va a Vision; cuando necesitas ambos, llama a Vision desde dentro de una herramienta de Foundation Models2. Los dos frameworks son capas complementarias, y la herramienta con argumento de imagen es la costura que las une.
Mantén la verificación de disponibilidad. La entrada de imágenes va sobre el mismo modelo, y el modelo «solo está disponible en dispositivos con Apple Intelligence»3. Verifica la API de disponibilidad y degrada con elegancia donde Apple Intelligence no esté presente3.
Preguntas frecuentes
¿Cómo le envío una imagen al modelo Foundation Models en iOS 27?
Insertas un adjunto de imagen en tu prompt junto al texto, usando el prompt builder existente, y luego le pides al modelo que responda. Apple describe la API como «una extensión natural de los prompt builders existentes»: crea una sesión, «simplemente inserta un adjunto de imagen en tu prompt, junto con texto», y «el modelo puede responder preguntas sobre la imagen»1. No interviene ningún pipeline de visión aparte ni un nuevo tipo de sesión.
¿Qué tipos de imagen puedo pasarle a Foundation Models?
Los adjuntos de imagen se pueden crear a partir de UIImage, NSImage, CGImage, tipos de Core Image, pixel buffers de CoreVideo y URL de archivos1. La transcripción enumera esos tipos de origen; no detalla cada firma de inicializador, así que deja que el SDK de iOS 27 aporte el punto de llamada exacto.
¿Necesito redimensionar o recortar las imágenes antes de enviarlas?
No. «El modelo admite imágenes de cualquier tamaño y relación de aspecto, así que no necesitas recortar ni rellenar para lograr una forma concreta»1. La contrapartida es el costo, no la legalidad: «las imágenes más grandes consumirán más tokens e implicarán más latencia»1, así que reducir una foto muy grande es una decisión de presupuesto cuando la tarea no necesita la resolución completa.
¿Cuándo debería usar Vision en lugar de Foundation Models para una imagen?
Usa Vision para tareas fijas, bien definidas y críticas en velocidad. Apple señala que Vision «usa un conjunto fijo de APIs de visión por computadora», está «finamente ajustada para tareas específicas» y es «a menudo lo bastante rápida como para analizar fotogramas de video en tiempo real», mientras que Foundation Models «puede hacer casi cualquier cosa que le pidas» y destaca en tareas descriptivas2. Cuando quieres ambas, llama a una herramienta respaldada por Vision desde una sesión de Foundation Models mediante llamadas a herramientas2.
¿La entrada de imágenes funciona con el modelo de servidor de Private Cloud Compute?
Sí. Apple confirma que el modelo en el dispositivo «ahora tiene soporte para entrada de imágenes»3, y la demostración de PCC pasa «el texto y las imágenes» de un documento a una LanguageModelSession para resumirlo3. La misma API unificada de Swift corre en ambos modelos, así que el mismo prompt con imágenes funciona en el dispositivo o en el servidor con un cambio de una sola línea. El contexto de 32K de PCC (frente a 4K en el dispositivo) les da más espacio a los prompts de varias imágenes3.
El clúster completo de Apple Ecosystem: la explicación del framework Foundation Models; el LLM en el dispositivo; el control de las llamadas a herramientas en iOS 27; y el análisis a fondo de Private Cloud Compute. El núcleo es la serie Apple Ecosystem. Para un contexto más amplio de iOS con agentes de IA, consulta la guía de desarrollo de agentes en iOS.
-
Apple, WWDC26 session 241, “What’s new in the Foundation Models framework.” developer.apple.com/videos/play/wwdc2026/241. Apple states the on-device model “is also gaining Vision capabilities,” describes the API as “a natural extension of the existing prompt builders” where you “simply insert an image attachment into your prompt, together with text,” lists the supported source types (
UIImage,NSImage,CGImage, Core Image types, CoreVideo pixel buffers, and file URLs), and notes the model “supports images in any size and aspect ratio” while “larger images will consume more tokens and incur more latency.” ↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩ -
Apple, WWDC26 session 237, “What’s new in image understanding.” developer.apple.com/videos/play/wwdc2026/237. Apple states “this year Foundation Models is supporting image inputs,” contrasts the Foundation Models LLM (“can do almost anything you ask them,” strong at descriptive tasks) with the Vision framework (“a fixed set of computer vision APIs,” “fine-tuned for specific tasks,” “fast enough to analyze video frames in real time”), and shows tool calling supporting image arguments via an
ImageReferenceto “an existing image from the current chat session” resolved through the session’s history. ↩↩↩↩↩↩↩↩↩↩↩ -
Apple, WWDC26 session 319, “Build with the new Apple Foundation Model on Private Cloud Compute.” developer.apple.com/videos/play/wwdc2026/319. Apple confirms the on-device model “now has support for image input,” states “the on-device model offers 4k, and with PCC you get 32K,” shows switching to the PCC server model “by changing just 1 line of code” through “a unified Swift API,” demonstrates feeding “the text and images” of a document into a
LanguageModelSession, advises choosing a model “based on data, not just vibes,” and notes reasoning “is extra text that the model generates” that “counts towards your context size limit.” ↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩↩ -
Apple Developer, “Foundation Models” framework documentation. Reference for
LanguageModelSession, the prompt builder, guided generation via@Generable, and theToolprotocol that the iOS 27 image-input and image-argument features extend. ↩