Compartir

Carlos del Porto Blanco

De seguro en algún momento usted habrá “conversado” con un modelo de lenguaje como ChatGPT, Claude o Deepseek. Es probable que haya escuchado o leído el término token. A menudo se presenta junto a un contador que aumenta o disminuye, o se menciona en las políticas de precios de las interfaces de programación. Sin embargo, rara vez se explica con claridad qué es y por qué importa. Este artículo busca explicar que es este concepto, ¿qué es un token en el contexto de la inteligencia artificial?, ¿de dónde viene?, ¿cómo funciona?, ¿para qué sirve?, ¿qué reservas despierta? y quiénes están detrás de su desarrollo.

Un token en inteligencia artificial es la unidad mínima de texto que los modelos de lenguaje utilizan para procesar y generar información; funciona como el “ladrillo” básico que traduce el lenguaje humano en secuencias numéricas comprensibles para las máquinas. Comprender los tokens es comprender la unidad básica de procesamiento del lenguaje en la era digital, el equivalente a los átomos en la química o los píxeles en una imagen digital. Su importancia ha crecido desde los años 1950 hasta la actualidad, siendo esencial en sistemas como los chatbots, traductores automáticos y modelos generativos como GPT o Llama. A este elemento dedicaré la columna de hoy.

La IA es una herramienta para aumentar nuestras capacidades, no para sustituirnos. Yann LeCun

En el ámbito de la inteligencia artificial, un token —traducido oficialmente al español como “token”— es la unidad mínima de información que un modelo de lenguaje procesa. No es una palabra, ni una letra, ni una frase. Es un fragmento de texto que el modelo trata como una unidad discreta. Puede ser un carácter individual, una palabra completa, una parte de una palabra, un signo de puntuación o incluso un espacio en blanco.

La analogía más útil es la de un collar de cuentas. Se ve la frase completa y se capta su significado de inmediato; el modelo, en cambio, ve una secuencia de cuentas —los tokens— y opera con ellas. No “lee” como un humano: descompone, traduce a números y calcula. Por eso, cuando se escribe “inteligencia artificial”, el modelo no recibe esa expresión como un bloque único, sino como una serie de tokens que pueden variar según el modelo: “inteligencia”, “ artificial”, o incluso “intel”, “igencia”, “ artificial”. Un hecho importante a considerar es que el idioma inglés es más eficiente en tokens que otros idiomas. Un texto en español o francés puede requerir entre un 20 % y 30 % más de tokens que el mismo contenido en inglés, lo que afecta directamente los costos de procesamiento. En inglés, una regla práctica muy citada es que un token es aproximadamente cuatro caracteres, aproximadamente 0.75 palabras. Eso implica que 100 tokens equivalen aproximadamente a 75 palabras en texto común en inglés.

Un estudio de la Universidad de Oxford —firmado por Aleksandar Petrov, Emanuele La Malfa, Philip Torr y Adel Bibi— encontró que la disparidad en el tratamiento de los idiomas surge ya en la etapa de “tokenización”, antes incluso de que se invoque el modelo, y mostró que procesar chino simplificado cuesta el doble que el inglés, mientras que el idioma shan de Birmania puede llegar a costar quince veces más. Según ese mismo trabajo, generar contenido en español resulta hasta un 50 % más caro que en inglés, porque el “tokenizador” —entrenado mayoritariamente con textos anglosajones— fragmenta peor las lenguas con otra morfología o alfabetos distintos. Esa desventaja no es solo económica: una ventana de contexto de 128 000 tokens rinde la mitad en japonés que, en inglés, lo que hace que el modelo pierda antes el hilo de una conversación larga en ese idioma.

Esa aparente minucia tiene consecuencias profundas. El número de tokens que un modelo puede procesar en una sola interacción —lo que se conoce como ventana de contexto— determina cuánta información puede “recordar” y con qué precisión puede responder. Y cuánto cuesta usar el modelo. Cuando una IA responde, genera sucesivamente nuevos tokens. En términos simplificados, cada paso consiste en calcular qué posibles tokens podrían continuar la secuencia y asignarles probabilidades.

La “tokenización” surgió, en buena medida, de una pregunta práctica: ¿cómo puede una computadora representar palabras que no conoce sin construir un vocabulario gigantesco? La respuesta —dividir el lenguaje en unidades reutilizables— contribuyó al desarrollo de sistemas capaces de trabajar con vocabularios enormes y múltiples idiomas.

Pero los tokens también recuerdan que la IA no percibe al mundo exactamente como lo hace una persona. Entre una pregunta humana y una respuesta generada existe una cadena de transformaciones matemáticas: texto, tokens, representaciones numéricas, cálculos neuronales y nuevos tokens.

Comprender esa cadena ayuda a desmitificar la inteligencia artificial. Un token no es un “pedazo de pensamiento”, ni una palabra mágica, ni una medida directa de inteligencia. Es una unidad técnica de representación y procesamiento. Su importancia reside en que, millones de veces repetida y combinada dentro de redes neuronales de gran escala, permite convertir el lenguaje humano en una forma que las máquinas pueden procesar. Y esa aparentemente humilde operación —partir el lenguaje en piezas— se encuentra en el corazón de una de las transformaciones tecnológicas más importantes de la informática contemporánea.

Una anécdota que hizo famosos a los tokens se produjo en el 2024: Un ejemplo trivial expuso ese mecanismo ante el público: varios chatbots fallaban al contar cuántas veces aparece la letra «r» en la palabra inglesa strawberry (fresa). El motivo es que el “tokenizador” de GPT-4 no ve la palabra como una secuencia de letras, sino que la divide en tres fragmentos —str, aw y berry—, cada uno con su propio código numérico. El modelo nunca «mira» las letras individuales; procesa identificadores de fragmentos, así que contar caracteres sueltos le resulta tan ajeno como pedirle a alguien que no lee chino que cuente los trazos de un carácter. El caso se volvió viral y sigue citándose como la manera más sencilla de explicar por qué esos sistemas, capaces de escribir ensayos complejos, tropiezan con tareas que a un niño le resultan triviales.

El caso de strawberry ilustra un problema más amplio: los números también se fragmentan en tokens de forma arbitraria, los modelos han cometido errores tan básicos como afirmar que 9.11 es mayor que 9.9, porque las cifras no siempre se dividen dígito por dígito.

No sólo para la inteligencia artificial.

Debo señalar que la “tokenización” puede ser utilizada también para otros fines, como salvaguardar datos sensibles que involucren, por ejemplo, datos personales (cuentas bancarias, estados financieros, registros médicos, antecedentes penales, licencias de conducir, solicitudes de préstamos, transacciones bursátiles, registros de votantes y otros tipos de información personal identificable). Ese proceso se utiliza a menudo en el procesamiento de tarjetas de crédito. El Consejo de la Industria de Tarjeta de Pago (PCI) define el “tokenización” como «un proceso por el cual el número de cuenta primario (PAN) es reemplazado por un valor sustituto llamado token.

El concepto de «tokenización», tal y como lo adopta hoy en día la industria, ha existido desde que surgieron los primeros sistemas monetarios hace siglos como medio para reducir el riesgo en el manejo de moneda física de alto valor, sustituyéndolos por equivalentes sustitutivos. En el mundo físico, las fichas de moneda tienen una larga historia de uso en sustitución del instrumento financiero de las monedas y billetes acuñados. En una historia más reciente, las fichas de metro y las fichas de casino fueron adoptadas por sus respectivos sistemas para reemplazar la moneda física y los riesgos de manejo de efectivo, como el robo.

En el mundo digital, desde los años 70 se han utilizado técnicas de sustitución similares para aislar los elementos de datos reales de la exposición a otros sistemas de datos. En las bases de datos, por ejemplo, se han utilizado valores claves artificiales desde 1976 para aislar los datos asociados con los mecanismos internos de las bases de datos y sus equivalentes externos para una variedad de usos en el procesamiento de datos. Más recientemente, esos conceptos se han ampliado para considerar esta táctica de aislamiento con el fin de proporcionar un mecanismo de seguridad a los efectos de la protección de datos.

En la industria de las tarjetas de pago, la conversión a token es un medio de proteger los datos sensibles de los titulares de las tarjetas para cumplir con los estándares de la industria y las regulaciones gubernamentales.

En 2001, TrustCommerce creó el concepto de “tokenización” para proteger los datos de pago sensibles de un cliente. Contrataron a TrustCommerce porque el riesgo de almacenar los datos del titular de la tarjeta era demasiado grande si sus sistemas eran pirateados, entonces se desarrolló TC Citadel®, donde los clientes podían referenciar un token en lugar de los datos del titular de la tarjeta y TrustCommerce procesaba un pago en nombre de los comerciantes. Esa aplicación de facturación segura permite a los clientes procesar pagos recurrentes de forma segura y sin necesidad de almacenar la información de pago del titular de la tarjeta. La “tokenización” reemplaza el número de tarjeta bancaria con tokens seguros generados aleatoriamente. Si se interceptan, los datos no contienen información del titular de la tarjeta, lo que los hace inútiles para los hackers. El número de tarjeta bancaria no puede ser recuperado incluso si el testigo y los sistemas en los que residen están comprometidos, ni tampoco puede el testigo ser sometido a ingeniería inversa para llegar al PAN.

Shift4 Corporation aplicó la “tokenización” a los datos de las tarjetas de pago y la dio a conocer al público durante una Cumbre de Seguridad de la industria celebrada en Las Vegas, Nevada, Estados Unidos en 2005. La tecnología está destinada a prevenir el robo de la información de la tarjeta de crédito almacenada. Shift4 define la “tokenización” como: «El concepto de usar un trozo de datos no desencriptados para representar, por referencia, datos sensibles o secretos. En el contexto de la industria de las tarjetas de pago (PCI), los tokens se utilizan para referirse a los datos del titular de la tarjeta que se gestionan en un sistema de “tokenización”, una aplicación o una instalación de seguridad externa».

Para proteger los datos a lo largo de todo su ciclo de vida, la conversión mediante “tokenización” se combina a menudo con un cifrado de extremo a extremo para asegurar los datos en tránsito hacia el sistema o servicio de conversión de token, con un token que sustituye a los datos originales a su regreso. Por ejemplo, para evitar los riesgos de que el malware robe datos de sistemas de baja confianza, como los terminales de puntos de venta (TPV), la encriptación de los datos del titular de la tarjeta debe realizarse antes de que los datos de la tarjeta entren en el TPV y no después. La encriptación tiene lugar dentro de los límites de un dispositivo de lectura de tarjetas validado y reforzado en materia de seguridad y los datos permanecen encriptados hasta que son recibidos por el host de procesamiento, un enfoque en el que Heartland Payment Systems, fue pionero como medio para asegurar los datos de pago frente a amenazas avanzadas, ahora ampliamente adoptado por las empresas de procesamiento de pagos y las empresas de tecnología de la industria. El Consejo PCI también ha especificado la encriptación de extremo a extremo (encriptación certificada de punto a punto-P2PE) para diversas implementaciones de servicios en varios documentos de encriptación de punto a punto del Consejo PCI.

Una breve historia de la “tokenización”.

En la década de 1950, los lingüistas computacionales trabajaban con «n-grams», secuencias de n palabras consecutivas utilizadas para análisis estadístico del lenguaje. Sin embargo, esos sistemas eran primitivos y no podían capturar el significado contextual. El punto de inflexión llegó en junio de 2017, cuando un equipo de investigadores de Google publicó el artículo «Attention is All You Need«, que introdujo la arquitectura «Transformer«. Ese modelo revolucionario no procesaba el texto palabra por palabra, sino que utilizaba un mecanismo de «atención» para analizar relaciones entre todas las palabras simultáneamente. Pero para que eso funcionara, el texto necesitaba ser convertido en unidades numéricas procesables: los tokens. En junio de 2018, la compañía OpenAI presentó GPT-1 (Generative Pre-trained Transformer 1), el primer modelo de lenguaje basado en transformers.

La idea de dividir el lenguaje en unidades discretas no nació con la inteligencia artificial moderna. En los albores del procesamiento del lenguaje natural (PLN), en las décadas de 1950 y 1960, los investigadores ya enfrentaban el problema de cómo representar las palabras para que las computadoras pudieran manipularlas. La solución más simple era tratar cada palabra como una unidad atómica: “tokenización” a nivel de palabra.

Pero ese enfoque tenía un defecto evidente: un vocabulario cerrado no puede cubrir todas las palabras de un idioma, y mucho menos las variantes, los errores tipográficos o los términos nuevos. A finales de los años noventa y principios de los 2000, la comunidad de procesamiento de lenguaje natural comenzó a explorar alternativas. La más influyente llegó en 1994, cuando Philip Gage propuso un algoritmo de compresión de datos llamado Byte-Pair Encoding (BPE). El algoritmo es un método general de compresión de datos, pensado para reducir el tamaño de ficheros. Dos décadas después, en 2016, los investigadores Rico Sennrich, Barry Haddow y Alexandra Birch adaptaron esa misma lógica —fusionar repetidamente el par de símbolos más frecuente— para resolver un problema de traducción automática, y la presentaron en un congreso de la Association for Computational Linguistics en Berlín. En 2019, un equipo de OpenAI liderado por Alec Radford llevó la técnica un paso más allá al aplicarla sobre bytes sin procesar para entrenar GPT-2, sentando la base que hoy usan prácticamente todos los grandes modelos de lenguaje.

El trabajo de Sennrich y sus colegas demostró que dividir las palabras en subunidades —fragmentos más pequeños que una palabra, pero más grandes que un carácter— permitía a los modelos manejar palabras desconocidas y reducir el tamaño del vocabulario sin sacrificar capacidad expresiva. El hallazgo fue tan relevante que, en 2026, la Universidad de Zúrich celebró el décimo aniversario de aquel artículo con un reconocimiento a su impacto en los sistemas de IA actuales.

Desde entonces, la “tokenización” por subpalabras se convirtió en el estándar. Modelos como BERT (Google, 2019), GPT-2 (OpenAI, 2019) y LLaMA (Meta, 2023) incorporaron variantes de ese enfoque, y hoy resulta difícil imaginar un modelo de lenguaje que no dependa de ese esquema.

¿Cómo funciona la tokenización?

El proceso es, en esencia, una operación de traducción. El texto original —una pregunta, un párrafo, un código de programación— pasa por un “tokenizador”, un programa que lo divide en tokens y asigna a cada uno un identificador numérico. A partir de ahí, el modelo trabaja exclusivamente con números.

Existen tres grandes familias de “tokenizadores”:

  1. “Tokenización” a nivel de palabra: el texto se divide por espacios y signos de puntuación. Es simple, pero genera vocabularios enormes y no maneja bien palabras desconocidas.
  2. “Tokenización” a nivel de carácter: cada carácter es un token. El vocabulario es pequeño, pero las secuencias resultan larguísimas y el modelo pierde eficiencia.
  3. “Tokenización” por subpalabras: el punto medio. Combina palabras frecuentes como unidades completas y fragmenta las menos comunes en partes. Es la estrategia que predomina hoy.

Dentro de la “tokenización” por subpalabras, tres algoritmos se reparten el protagonismo. BPE (Byte-Pair Encoding) fusiona iterativamente los pares de caracteres más frecuentes hasta formar unidades más grandes; es el utilizado por la familia GPT de OpenAI. WordPiece, desarrollado por Google, emplea un criterio probabilístico para decidir qué fragmentos conservar, y es el “tokenizador” de BERT. SentencePiece, creado por Taku Kudo y John Richardson en 2018, por su parte, no es un algoritmo en sí mismo, sino una biblioteca que implementa BPE y Unigram, y que se caracteriza por operar directamente sobre el texto sin preprocesamiento, lo que la hace especialmente útil para lenguajes sin espacios entre palabras, como el chino o el japonés.

La elección del “tokenizador” no es un detalle menor. Un estudio comparativo de 2025 encontró que BPE ofrece mejor especialización contextual, SentencePiece logra mayor eficiencia de codificación y WordPiece representa un compromiso equilibrado entre ambos. En la práctica, eso significa que dos modelos con arquitecturas similares pueden comportarse de manera muy distinta según cómo dividan el texto.

Resumen de qué es un token

  • Definición: Un token es un fragmento de texto que puede ser una palabra, parte de una palabra, un carácter o incluso un espacio.
  • Ejemplo: La frase “Buenos días” en español se divide en cuatro tokens, mientras que “Good morning” en inglés se divide en dos.
  • Función: Permiten que los modelos reduzcan la complejidad del lenguaje, asociando cada token con un identificador numérico único.
  • “Tokenización” en español: Debido a acentos y conjugaciones, una palabra puede dividirse en más tokens que en inglés.
  • Economía de tokens (tokenomics): El límite de tokens define la “ventana de contexto” de un modelo, es decir, cuánta información puede recordar en una conversación.
  • Analogía histórica: Al igual que los tipos móviles de Gutenberg en el siglo XV permitieron imprimir textos, los tokens son hoy los bloques que permiten a las máquinas “leer” y “escribir”.

Utilidad: el token como unidad de medida y de negocio.

La importancia del token trasciende lo técnico. Se ha convertido en la unidad de medida de la economía de la inteligencia artificial. Los proveedores de modelos de lenguaje cobran por token procesado: por cada token de entrada (lo que el usuario escribe) y por cada token de salida (lo que el modelo genera). Esa lógica de precios convierte al token en una suerte de “kilovatio-hora” de la IA: una unidad que permite medir, comparar y facturar el consumo de un recurso.

Los números hablan por sí solos. Según datos oficiales, la demanda diaria de tokens en China pasó de mil millones a principios de 2024 a más de 140 billones en marzo de 2026, un crecimiento de más de mil veces en poco más de dos años. Ese volumen no solo refleja la popularización de los asistentes conversacionales; también indica que el token se ha consolidado como el denominador común de una industria que factura por unidades de cómputo lingüístico.

La eficiencia en la “tokenización” tiene un impacto directo en el costo. Un análisis de 2026 sobre 17 modelos comerciales reveló que la relación media de tokens por palabra varía entre 1.18 (el “tokenizador” más eficiente, de DeepSeek) y 1.35 (el de Anthropic), una diferencia que, a escala de millones de consultas, se traduce en millones de dólares. Además, los tokens de salida suelen costar entre cuatro y ocho veces más que los de entrada, lo que incentiva a los desarrolladores a optimizar la verbosidad de sus modelos.

Más allá del costo, el token también determina la capacidad operativa de un modelo. Si la ventana de contexto es de 128 000 tokens —como la de GPT-4o—, el modelo puede procesar el equivalente a unas 96 000 palabras en una sola interacción. Esa cifra condiciona lo que el modelo puede leer, recordar y “razonar” de una vez.

Resumen de la utilidad práctica.

  • Procesamiento del lenguaje natural (PLN): Chatbots, traductores, asistentes de voz.
  • Generación de texto: Modelos como GPT o Gemini dependen de tokens para producir respuestas.
  • Optimización de costos: El número de tokens procesados determina el consumo de recursos y, en muchos casos, el precio de uso de un modelo.

Reservas y críticas: cuando el token no es neutro.

La “tokenización” no es una operación aséptica. Lejos de ser un simple mecanismo de compresión, el “tokenizador” codifica decisiones sobre qué fragmentos del lenguaje merecen ser tratados como unidades y cuáles no. Y esas decisiones tienen consecuencias.

La crítica más documentada es el sesgo lingüístico. Investigaciones publicadas en 2024 y 2025 han demostrado que los “tokenizadores” de los grandes modelos —entrenados predominantemente con datos en inglés— representan de manera deficiente las lenguas con menos recursos. Un estudio sobre GPT-4o encontró que su “tokenizador” produce una proporción significativa de tokens “subentrenados” o “no entrenados” cuando procesa chino, coreano o lenguas del noreste de India, lo que se traduce en respuestas alucinadas, pérdida de matices y perpetuación de sesgos culturales. El AI Index Report de 2024 ya había señalado esa asimetría: la “tokenización” penaliza a los idiomas no occidentales, que requieren más tokens para expresar lo mismo y, por tanto, resultan más costosos de procesar.

A esto se suma una preocupación creciente por la seguridad de la información. Un estudio de 2026 reveló que el “tokenizador” BPE, utilizado por los modelos de código más populares, exhibe un comportamiento que los autores denominan gibberish bias: ciertas cadenas sensibles —como claves de API o contraseñas— se fragmentan de manera que el modelo las memoriza con más facilidad de la prevista, aumentando el riesgo de filtraciones. La “tokenización”, que debería ser una capa neutral de preprocesamiento, se convierte así en un vector de vulnerabilidad.

Esas críticas no invalidan la utilidad del token, pero sí subrayan que su diseño no es ideológicamente inocente. Como señaló un análisis de 2024, los sesgos algorítmicos pueden emerger “directamente de los mecanismos técnicos mismos”, y la “tokenización” es uno de ellos. Como ya señalé, aunque los tokens no son recursos físicos, sí existen “reservas” en forma de vocabularios entrenados. Cada modelo de IA tiene su propio conjunto de tokens:

  • OpenAI (GPT): Vocabulario entrenado principalmente en inglés, con adaptaciones a otros idiomas.
  • Google DeepMind (Gemini): Optimización multilingüe con “tokenización” avanzada.
  • Meta (LLaMA): Diseñado para investigación abierta, con “tokenización” eficiente para múltiples lenguas.

Un elemento que está definiendo el ritmo de avance de la inteligencia artificial es la eficiencia y la sostenibilidad. Un elemento crítico es que el procesamiento de tokens tiene un costo ambiental significativo. Entrenar un modelo como GPT-4 consumió aproximadamente 50 GWh de electricidad, equivalente al consumo anual de aproximadamente cinco mil hogares estadounidenses. Cada token generado requiere energía computacional, y a medida que las aplicaciones de IA se masifican, la huella energética y de agua del procesamiento de tokens se convierte en un desafío de sostenibilidad.

Cada token que un modelo procesa o genera implica cálculo en centros de datos que consumen electricidad y agua para refrigeración. Un centro de datos puede usar hasta 1.5 millones de litros de agua al día solo para enfriar sus sistemas, y organismos como la Universidad de las Naciones Unidas han advertido que ese consumo podría duplicarse en pocos años a medida que crece la demanda de IA generativa.

Productores y hechos importantes.

El ecosistema de la “tokenización” está dominado por unos pocos actores, pero su influencia se extiende a toda la industria.

OpenAI ha sido uno de los principales impulsores de BPE. Su biblioteca tiktoken, de código abierto, permite a los desarrolladores visualizar cómo se “tokeniza” un texto y ha sido adoptada como referencia por buena parte de la comunidad. Google desarrolló WordPiece para BERT y ha seguido refinando sus “tokenizadores” en modelos posteriores. Meta emplea “tokenizadores” basados en BPE en su familia LLaMA, y Anthropic utiliza su propio “tokenizador” para la serie Claude, que según los benchmarks es uno de los menos eficientes en términos de tokens por palabra. En el ámbito de los modelos abiertos, DeepSeek destaca por un “tokenizador” especialmente eficiente para el chino, con una ratio de compresión de 1.45 caracteres por token.

Un hito reciente ilustra la consolidación del token como concepto público: en marzo de 2026, el Comité Nacional de Revisión de Términos Científicos y Tecnológicos de China aprobó oficialmente cíyuán como la traducción estándar de token en el ámbito de la inteligencia artificial. Poco después, el director de la Administración Nacional de Datos de China utilizó el término en una rueda de prensa, describiéndolo como “el ancla de valor de la era inteligente y la unidad de liquidación que conecta la oferta tecnológica con la demanda comercial”. Este hecho es revelador: un término que hace una década era jerga de programadores se ha convertido en una unidad de política económica.

Resumen de su historia y evolución

  • Década de 1950: Los primeros lingüistas y científicos computacionales comenzaron a representar el lenguaje en unidades mínimas para que las máquinas pudieran analizarlo.
  • Años 1980-1990: Se usaron tokens en algoritmos de clasificación de texto y recuperación de información.
  • 2017: publicación del articulo “Attention Is All You Need”, que establece el Transformer y la centralidad del token como unidad de procesamiento.
  • 2018–2020: surgimiento de los modelos BERT, GPT-2 y GPT-3, que popularizan el uso de tokens en aplicaciones masivas.
  • 2023–2026: consolidación de modelos multimodales y de razonamiento, con facturación explícita por tokens de entrada, salida y razonamiento, y herramientas públicas de “tokenización”.
  • 2026: guías de “prompting” de OpenAI destacan que una redacción más eficiente puede reducir hasta un 66 % el uso de tokens sin perder calidad, evidenciando la madurez de la “ingeniería de tokens” como disciplina práctica.

El token es, en apariencia, un detalle técnico. Pero su historia —desde los algoritmos de compresión de datos de los años noventa hasta las decisiones de política lingüística de 2026— revelan que ocupa un lugar central en la infraestructura de la inteligencia artificial contemporánea. Es la unidad que permite medir, cobrar y comparar el trabajo de los modelos de lenguaje; es también el punto donde se manifiestan sesgos culturales y vulnerabilidades de seguridad que la industria apenas comienza a abordar.

Entender qué es un token no requiere conocimientos de programación. Requiere, simplemente, aceptar que cuando se interactúa con una computadora, esta no escucha como los seres humanos la escuchan a ella. Nosotros escuchamos frases; ella realiza cálculos. Y éstos —los tokens— son el material con el que se construye, día a día, la conversación entre humanos y algoritmos.

Referencia.

Etiquetas: