Los últimos avances en IA tienen como objetivo desarrollar el modelo de base tabular (TFM).
getty
En la columna de hoy, examino el auge de los modelos de base tabular (TFM). Este modelo basado en IA es bastante similar al modelo de lenguaje grande (LLM), aunque TFM está diseñado específicamente para manejar datos tabulares. Hacerlo es bastante útil porque los LLM convencionales no son muy buenos para manejar datos tabulares o de hojas de cálculo (los LLM normales tienden a fallar o fallar al analizar datos, por ejemplo).
Verá, los LLM convencionales intentan tratar los datos tabulares como si pudieran codificarse completamente en tokens, como si estuvieran compuestos exclusivamente de texto. Los TFM están diseñados para tratar los datos tabulares como deben ser tratados, es decir, los datos numéricos se tratan como números. Un TFM identifica patrones cruciales asociados con datos que residen en filas y columnas. Esto es muy útil para cualquiera que investigue hojas de cálculo o datos tabulares y espere apoyarse en la IA para descubrir información valiosa. Te explicaré los conceptos básicos de los TFM. También debe conocer los pros y los contras de cuándo y cómo utilizar este nuevo y potente modelo de IA.
Hablemos de ello. Este análisis de los avances en IA es parte de mi reciente columna de Forbes sobre IA, que incluye la identificación y explicación de las diversas complejidades que afectan a la IA (ver enlace aquí).
Configuración de IA generativa con LLM
Antes de pasar al TFM, será útil considerar algunos antecedentes útiles sobre el LLM.
Una forma común de configurar la IA generativa y el LLM consiste en escanear primero la gran cantidad de datos escritos disponibles en Internet. Todos los LLM conocidos hacen esto, incluidos ChatGPT y GPT-5 de OpenAI, Claude de Anthropic, Gemini de Google, Copilot de Microsoft, Grok de xAI, etc. El escaneo permite a la IA hacer coincidir patrones en la escritura humana. Los patrones almacenados en estructuras de datos a gran escala se basan libremente en aspectos del software húmedo humano (vagamente parecido a nuestro cerebro), implementado como una red neuronal artificial (RNA). Para obtener más información sobre cómo funciona todo esto, consulte mi discusión en el enlace aquí.
Después de la formación inicial, un fabricante de IA emprende un proceso de ajuste conocido como RLMF (aprendizaje por refuerzo a partir de la retroalimentación humana). Consiste en contratar testers humanos que brinden retroalimentación a la IA. Los evaluadores humanos hacen una serie de preguntas y califican la naturaleza de las respuestas. Estas voces superiores y voces inferiores proporcionan a la IA instrucciones matemáticas y computacionales sobre cómo responder preguntas. Por ejemplo, si los evaluadores deben asegurarse de que la IA sea educada durante la interacción con el usuario, votarán “por favor” y “gracias” (consulte mi explicación detallada en el enlace aquí).
Hay varias formas adicionales de configurar y desarrollar LLM. El creador de la IA generalmente proporcionará una guía del sistema a la IA que le indica cómo actuar hacia el usuario. He descomprimido la gran extensión de varias indicaciones de IA en todo el sistema; vea el enlace aquí. Los esfuerzos de los fabricantes de IA tienen como objetivo guiar la IA sobre cómo se comportará una vez que esté lanzada y disponible para el público.
Dificultad con datos tabulares
Las personas a menudo se sienten tentadas a utilizar LLM para ayudar a explorar datos tabulares. Una persona puede tener una hoja de cálculo que contiene datos comerciales y está interesada en que el LLM encuentre patrones útiles en los datos. Eligieron cargar una hoja de cálculo en LLM y brindar orientación que le indique a la IA que identifique relaciones importantes entre filas y columnas de datos.
Hay muchos problemas al hacer esto.
Un aspecto notable es que la mayoría de los LLM intentan examinar los datos convirtiéndolos todo en tokens que básicamente representan contenido orientado a texto (para obtener detalles sobre cómo funciona la tokenización, consulte mi discusión en el enlace aquí). Supongamos que la hoja de cálculo contiene la edad de los clientes y la cantidad de mercancía que han comprado. Números como 36 años y un monto de compra de $8,500 se convertirán en tokens como si no fueran números. El número 36 consta del carácter “3” seguido del carácter “6”. Usted y yo sabemos que se supone que esto representa un valor numérico y no solo dos caracteres de texto consecutivos.
La IA tendrá dificultades para establecer conexiones matemáticas entre la edad del cliente y las compras porque los datos no están codificados como números per se. Esto también afectará a elementos numéricos importantes como la precisión y la exactitud. Lo más probable es que LLM cometa todo tipo de errores al no tratar los datos como numéricos.
Modelos de base tabular (TFM)
La idea es comenzar desde cero y diseñar una IA que maneje cuidadosamente los datos tabulares. Reutilizaremos muchas de las mismas prácticas y técnicas para realizar el LLM. Una diferencia clave es que queremos que TFM esté listo para datos numéricos, y que los datos se alojen en filas y columnas, y que los datos probablemente contengan una combinación de información numérica y basada en texto.
Además de eso, queremos que TFM se ocupe de los tipos correctos y típicos de problemas y errores de datos que surgen en los datos sin procesar. Esto incluye valores faltantes, valores que están extrañamente fuera de rango, valores no numéricos que se encuentran en campos numéricos, etc. TFM debe buscar anomalías en los datos que pueden estar en cualquier parte de los datos tabulares.
También queremos que TFM descubra la relación entre filas y columnas. ¿Hay correlaciones que se destacan? ¿Tiene la distribución numérica de valores en filas o columnas un significado notable? ¿Hay efectos estacionales en los datos? La conclusión es que TFM debe ser un motor con conocimientos estadísticos que busque relaciones matemáticas sustantivas y que no se deje engañar fácilmente por relaciones engañosas o falsas.
formación TFM
Mencioné anteriormente que un LLM se entrena principalmente en datos escaneando ampliamente Internet en busca de contenido escrito por humanos. Para TFM, podemos imaginar que se puede hacer lo mismo escaneando hojas de cálculo y otros datos tabulares que se encuentran comúnmente en Internet. La suposición es que lo que funciona para el ganso debe funcionar para el ganso.
Desafortunadamente, no es tan fácil como parece. Intentar escanear datos tabulares es más difícil que buscar contenido textual. Los datos tabulares se pueden combinar sin ton ni son. Mucho de esto es pura basura. Los datos no aportan ningún beneficio. Por el contrario, cuando se forma un LLM, la mayor parte del contenido basado en texto suele ser de algún tipo y puede tomarse al pie de la letra.
Idealmente, nos gustaría encontrar datos tabulares que puedan tener algún texto asociado que explique de qué se tratan los datos. Si podemos encontrar un texto que proporcione una interpretación de los datos, esto será especialmente beneficioso. TFM puede comparar datos tabulares con texto y usarlos para obtener una apariencia adicional de lo que la gente busca en los datos tabulares.
La conclusión es que, en lugar de obtener datos de Internet, los TFM a menudo se capacitan creando datos personalizados para fines de capacitación de TFM. Los desarrolladores de IA primero crean muchos conjuntos de datos tabulares y los preparan para realizar el entrenamiento TFM. Los desarrolladores ingeniosos intentan formar datos realistas, que contengan espacios en blanco, valores impares, etc. Estos datos generados o sintéticos deben ser similares a los datos del mundo real. Sería de valor limitado simplemente bombear datos puros a TFM durante el entrenamiento. TFM no estará preparado para manejar situaciones del mundo real.
Un ejemplo reciente es el TFM.
Los TFM más populares actualmente incluyen TabFM (Google Research), TabPFN (Prior Labs), TabICL (SODA), KumoRFM (Nvidia / Kumo) y otros también están en proceso. En esta etapa, generalmente se lleva a cabo como parte de esfuerzos de investigación avanzada de IA y/o lo llevan a cabo empresas emergentes audaces.
En definitiva, se trata de un área emergente de investigación y práctica. Destaco ese punto para enfatizar que los TFM todavía están en su infancia. Si elige utilizar TFM, hágalo con la mentalidad de que este nuevo tipo de modelo de IA se está desarrollando y debe tener mucho cuidado. Lo más probable es que tengas que levantar algo de peso. Esto no es un botón.
También existe el objetivo de crear un TFM que sea general o esté diseñado para un dominio específico. Esto es lo que quiero decir. El TFM se puede crear para respaldar todos los dominios de interés, como datos tabulares financieros, datos tabulares relacionados con la salud, datos tabulares de inventario, datos tabulares de servicio al cliente, etc. Un TFM de base amplia intentará ser un experto en todos los oficios.
A veces, un TFM de base amplia no puede hacer un trabajo tan bueno en un dominio específico como lo haría un TFM diseñado para el dominio de interés. Por ejemplo, los desarrolladores de IA pueden concentrarse en crear TFM que maneje principalmente datos tabulares médicos. Eso es lo que hace este TFM en particular. Cualquiera que lo utilice debe tener en cuenta que es posible dirigir TFM a otros dominios, pero probablemente sería más prudente buscar TFM dirigido a otros dominios o que se consideren amplios.
Investigaciones recientes en TFM
Echemos un vistazo breve a un TFM, a saber, TabFM. En un artículo de investigación publicado recientemente titulado “Presentación de TabFM: un modelo básico de disparo cero para datos tabulares” de Weihao Kong, Abhimanyu Das, investigación de googleEl 30 de junio de 2026, se plantearon los siguientes puntos importantes (extractos):
- “Hoy presentamos TabFM, un modelo fundamental diseñado específicamente para la clasificación y regresión de datos tabulares”.
- “Los datos tabulares son la columna vertebral de la infraestructura de datos empresariales y alimentan una fracción significativa de las aplicaciones críticas de aprendizaje automático predictivo”.
- “El modelo de lenguaje estándar procesa un orden ordenado unidimensional, pero la tabla es básicamente bidimensional e inherentemente desordenada: intercambiar dos filas o dos columnas no cambia el significado básico de los datos”.
- “TabFM está entrenado completamente en cientos de millones de conjuntos de datos sintéticos”.
- “Como resultado, el modelo se generaliza a tablas del mundo real que no son visibles, como mostramos en nuestros puntos de referencia”.
Este TFM es uno de los clásicos hoy en día en este ámbito y está en constante actualización y mejora. Si te interesa el tema del TFM, te invito a que consideres la lectura del artículo citado anteriormente. Los investigadores optaron por utilizar un módulo de atención multicapa y seguir el método inteligente de alternar la atención entre filas y columnas. El enfoque incluye compresión de líneas y hace un uso extensivo del aprendizaje en contexto (ICL).
El futuro es híbrido
Mi predicción es que no solo veremos avances en los TFM, sino que también terminaremos conectando y combinando LLM y TFM. Iniciará sesión en su LLM todos los días y, cuando solicite ayuda de IA en el análisis de datos tabulares, LLM se conectará con TFM y lo usará detrás de escena para usted. LLM será su interfaz de lenguaje natural y TFM será su caballo de batalla de datos tabulares.
He predicho que el futuro de la IA serán los modelos básicos híbridos, incluidos los modelos básicos neurosimbólicos, los híbridos LLM-TFM, etc. Vea mi pronóstico detallado en el enlace aquí.
Un último pensamiento por ahora. La famosa matemática y pionera en informática Ada Lovelace dijo lo siguiente: “Uno de los objetivos importantes es elegir una disposición que reduzca el tiempo necesario para completar un cálculo”. Yo diría que usar TFM para ayudar a analizar sus datos tabulares es un ejemplo perfecto de cómo elegir la disposición correcta para un problema complejo.