Saltar al contenido

Google estrena SL2T en el Pixel 11: traduce ASL a texto, pero no sustituye a intérpretes

Google DeepMind llevó SL2T a Gboard y Live Transcribe en el Pixel 11. La primera versión traduce ASL a inglés y está limitada a tareas cotidianas de bajo riesgo.

por Dilis Salazar
Google estrena SL2T en el Pixel 11: traduce ASL a texto, pero no sustituye a intérpretes

TL;DR:

  • Google DeepMind estrenó SL2T en Gboard y Live Transcribe del Pixel 11 para convertir señas en texto.
  • El modelo se entrenó con más de 100,000 horas en más de 50 lenguas de señas, pero al lanzamiento solo traduce ASL a inglés en el mercado estadounidense.
  • Google y su comité asesor lo definen como una ayuda para tareas cotidianas, no como sustituto de intérpretes en situaciones médicas, legales o institucionales.

Google DeepMind presentó el 12 de agosto de 2026 SL2T, un modelo que convierte lengua de señas en texto y debuta en Gboard y Live Transcribe en el Pixel 11. Su primera versión traduce lengua de señas estadounidense (ASL) a inglés y permite escribir mensajes, hacer búsquedas, redactar documentos o responder en una conversación apuntando la cámara hacia quien hace las señas. El lanzamiento lleva esta tecnología a un producto de consumo, pero con un alcance mucho más estrecho que la etiqueta “multilingüe”: el informe oficial la limita a usos cotidianos de bajo riesgo y advierte que no reemplaza a un intérprete.

SL2T traduce movimientos corporales, no palabras aisladas

Una lengua de señas no es un idioma hablado trasladado a las manos. Tiene gramática y vocabulario propios, y comunica significado mediante movimientos simultáneos de manos, brazos, torso, cabeza y rostro. Por eso SL2T realiza una traducción entre lenguas en vez de asignar una palabra a cada gesto.

Google estima que más de 70 millones de personas sordas o con pérdida auditiva utilizan más de 200 lenguas de señas en el mundo. Esa diversidad ayuda a dimensionar la diferencia entre el entrenamiento del modelo y el producto disponible durante su estreno.

El procesamiento comienza en el teléfono. MediaPipe Holistic extrae en cada fotograma coordenadas bidimensionales de 130 puntos del rostro, el cuerpo y las manos. Solo esa representación geométrica viaja a los servidores de Google para que SL2T genere el texto; la traducción no ocurre por completo en el dispositivo. Según el informe de impacto, el video original se descarta de inmediato y Google no conserva registros de las entradas ni de las salidas, salvo que la persona los autorice expresamente para un estudio de evaluación.

Ese diseño reduce la información visual que sale del teléfono, pero también elimina pistas. Los puntos no registran los movimientos de la lengua dentro de la boca, la profundidad entre dos partes del cuerpo ni los objetos del entorno a los que una persona podría referirse. SL2T procesa las coordenadas directamente y evita las etiquetas intermedias conocidas como glosas, que simplifican cada seña y pueden perder expresiones faciales o construcciones espaciales.

Google entrenó el modelo con más de 100,000 horas de datos de más de 50 lenguas de señas; aproximadamente una cuarta parte corresponde a ASL. En FLEURS-ASL, un conjunto de evaluación para traducción de ASL a inglés, la empresa reportó una puntuación zero-shot de 70 en BLEURT y la calificó como superior a resultados anteriores. El propio material oficial documenta errores con señas poco frecuentes, deletreo rápido, tiempos verbales y detalles expresados mediante clasificadores.

Gboard convierte las señas en una forma de dictado

En Gboard, la persona puede hacer señas frente a la cámara en cualquier campo donde normalmente escribiría. El texto resultante sirve para buscar en la web, redactar mensajes y documentos o enviar instrucciones a Gemini. Antes de utilizarlo, el usuario puede corregirlo con el teclado.

Live Transcribe aplica la misma idea a conversaciones presenciales. La pantalla muestra la transcripción de lo que dice la otra persona y ofrece un espacio separado para preparar la respuesta con señas. El texto no se muestra ni se reproduce automáticamente: quien hace las señas decide cuándo compartirlo.

Esta verificación humana forma parte del diseño, no es un paso opcional ante casos excepcionales. El informe advierte que el usuario necesita suficiente dominio del inglés para detectar errores y poder manejar los controles de edición. SL2T genera un borrador asistido; no interpreta de forma autónoma una conversación completa.

Google deja fuera los escenarios de alto riesgo

Google DeepMind publicó el informe junto con el AI Sign Language Advisory Committee, integrado por organizaciones y especialistas de la comunidad sorda. El documento sitúa el uso previsto en búsquedas, mensajes, notas, consultas a asistentes y conversaciones informales de una sola persona a la vez, por ejemplo al pedir en una cafetería o solicitar ayuda en una tienda.

La versión 1.0 no fue diseñada ni validada para situaciones donde una traducción incorrecta puede afectar derechos, salud, educación o empleo. El documento deja fuera estos ámbitos:

  • consultas médicas, emergencias, salud mental y consentimiento informado;
  • interrogatorios, tribunales, declaraciones y asesoría legal;
  • evaluaciones académicas, clases y reuniones de educación especial;
  • entrevistas de trabajo, revisiones de desempeño y procesos disciplinarios;
  • audiencias administrativas y decisiones sobre servicios o beneficios públicos.

El comité también alerta sobre el riesgo de que instituciones sustituyan a intérpretes certificados para ahorrar costos. SL2T solo traduce las señas a texto: no convierte el habla en señas, no puede pedir aclaraciones y carece del criterio cultural, ético y legal de un profesional. Google y el comité sostienen que la herramienta no satisface por sí misma las obligaciones de accesibilidad que corresponden a un intérprete humano.

Las limitaciones técnicas explican esa frontera. La traducción pierde precisión con poca luz, contraluz, ángulos extremos o cuando parte del cuerpo sale del encuadre. Solo sigue al sujeto más grande de la imagen, trabaja con clips de hasta 60 segundos y no conserva el contexto de turnos anteriores. También puede fallar con expresiones faciales, gramática compleja, variantes regionales, nombres propios, siglas y secuencias numéricas.

Las pruebas previas documentaron “texto fantasma” cuando alguien entraba en el cuadro, el usuario hacía una pausa o mantenía las manos quietas. Google afirma que redujo esas alucinaciones para la versión pública, pero no las eliminó. SL2T tampoco fue entrenado ni evaluado formalmente con menores de 18 años, y su evaluación con personas con discapacidades motoras o patrones de movimiento atípicos sigue siendo limitada.

El modelo es multilingüe, pero el producto aún no lo es

La primera versión apunta a ASL en el mercado de Estados Unidos y produce texto en inglés. Google no anunció compatibilidad inicial con la Lengua de Señas Mexicana, la Lengua de Signos Española ni salida en español. La compañía prometió sumar idiomas y dispositivos, sin publicar un calendario, y dijo que el acceso no tendrá costo adicional.

El hardware también acota el debut. El Pixel 11 parte de 899 dólares en Estados Unidos y llega a tiendas el 20 de agosto; en España las reservas abrieron desde 999 euros, mientras que México todavía no tiene precio ni fecha de venta confirmados. La disponibilidad del teléfono fuera de Estados Unidos no confirma que SL2T esté habilitado en esos mercados.

Pixel 11: precio desde 899 dólares y adiós a 128 GB
Pixel 11, 11 Pro y 11 Pro XL desde 899 dólares, con venta el 20 de agosto y sin versión de 128 GB.

SL2T abre una vía de entrada por señas en dos aplicaciones de uso diario, pero su impacto inicial depende de tres límites concretos: un solo par lingüístico, el Pixel 11 y un despliegue orientado a Estados Unidos. Para la comunicación de alto riesgo, el propio lanzamiento conserva al intérprete humano como la referencia necesaria.

Fuentes: 1, 2, 3

Dilis Salazar imagen de perfil
por Dilis Salazar

Suscríbete GRATIS

Recibe las noticias más importantes de política, tecnología, negocios, deportes, entretenimiento y cultura directamente en tu correo.

¡Listo! Revisa tu correo

Para completar la suscripción, haz clic en el enlace de confirmación que enviamos a tu correo. Si no llega en 3 minutos, revisa tu carpeta de spam.

Ok, gracias

Leer más de Tecnología y Ciencia