Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI El informe de supervivencia humana
ES

Cómputo y leyes de escalado, explicados

Qué predicen las leyes de escalado de la IA, dónde fallan sus pronósticos, y por qué el cómputo sigue siendo una señal de gobernanza imperfecta pero útil.

Escrito por
Dwight Ringdahl
Status
Fuentes verificadas
Revisado
Fuentes
4 citadas
Lectura
7 min

Una ley de escalado es una relación empírica

En el aprendizaje automático, una ley de escalado describe cómo cambia una cantidad medida a medida que crece un insumo. Para los modelos de lenguaje grandes, los investigadores descubrieron que la pérdida de entrenamiento a menudo mejora de forma relativamente suave y predecible a medida que aumentan el tamaño del modelo, los datos de entrenamiento y el cómputo. El trabajo de OpenAI de 2020 reportó relaciones de ley de potencia en los rangos probados (Kaplan et al.). El estudio posterior “Chinchilla” de DeepMind mostró que, bajo un presupuesto de cómputo fijo, muchos modelos habían sido entrenados con muy pocos datos y que los parámetros y los tokens de entrenamiento debían escalarse juntos de forma más equilibrada (Hoffmann et al.).

Estos resultados fueron importantes porque hicieron más predecibles las ejecuciones de entrenamiento costosas. Un laboratorio podía realizar experimentos más pequeños, estimar cómo cambiaría la pérdida a mayor escala, y asignar un presupuesto entre datos, parámetros y cómputo. Pero la ley describe mediciones dentro de un régimen observado. No es una garantía física de que toda capacidad mejorará indefinidamente, ni de que suficientes procesadores gráficos produzcan automáticamente AGI.

El cómputo es solo un ingrediente

“Cómputo” suele significar el número de operaciones numéricas usadas en el entrenamiento o la inferencia, pero incluso esa abreviatura oculta diferencias importantes. Dos ejecuciones de entrenamiento con las mismas operaciones nominales pueden producir sistemas diferentes debido a la utilización de chips, la precisión numérica, la calidad de los datos, la arquitectura, la optimización y el software. Las mejoras algorítmicas pueden obtener mejor rendimiento del mismo hardware. El ajuste fino, la recuperación de información, las herramientas, la memoria y el andamiaje de agentes pueden cambiar sustancialmente el comportamiento desplegado después del preentrenamiento.

Los datos importan tanto en cantidad como en composición. Los ejemplos duplicados, de baja calidad o contaminados no son equivalentes a información cuidadosamente seleccionada. Los datos sintéticos pueden extender o dirigir un corpus, pero los errores pueden amplificarse si la generación y el filtrado son deficientes. Los derechos de datos, la privacidad, la cobertura lingüística y la representación también influyen en lo que aprende un modelo.

El cómputo en tiempo de inferencia añade otra dimensión. Algunos sistemas gastan más operaciones generando y verificando candidatos intermedios para una instrucción difícil. Esto puede mejorar el rendimiento sin cambiar el modelo preentrenado, pero aumenta el costo y la latencia y no garantiza la corrección. Una discusión completa sobre escalado ahora necesita considerar al menos el cómputo de entrenamiento, el cómputo de inferencia, los datos, los algoritmos y el sistema circundante.

Las curvas de pérdida no son curvas de capacidad

La pérdida de entrenamiento mide el error predictivo promediado en conjuntos de datos enormes. Una reducción suave en la pérdida puede acompañar cambios irregulares en tareas orientadas a humanos. Una prueba de referencia puede mostrar un umbral porque una mejora latente finalmente cruza su marca de aprobación, porque el modelo aprende varias subhabilidades requeridas, o porque la puntuación convierte el progreso gradual en un resultado binario. Otras habilidades pueden mejorar suavemente, mantenerse planas, o retroceder después del ajuste de seguridad o cambios en el sistema.

Esta distinción evita dos errores opuestos. El primero es asumir que una curva de pérdida predecible hace predecible todo comportamiento futuro. No es así. El segundo es afirmar que todas las ganancias de capacidad son discontinuidades misteriosas. Muchas ganancias de referencia aparentemente abruptas se vuelven más suaves cuando los investigadores usan métricas continuas o pruebas más informativas (Schaeffer, Miranda y Koyejo, 2023). Tanto la incertidumbre como la predictibilidad parcial pueden ser ciertas.

El escalado también interactúa con el diseño de la evaluación. Las pruebas públicas pueden saturarse o filtrarse a los datos de entrenamiento. Un modelo puede mejorar en presentar pruebas sin una ganancia equivalente en fiabilidad del mundo real. Por el contrario, las pruebas de referencia existentes pueden pasar por alto capacidades útiles. Se necesitan múltiples evaluaciones, tareas privadas, revisión de expertos humanos y evidencia de despliegue para interpretar lo que compró la reducción de la pérdida.

Dónde puede doblarse la tendencia

La capacidad física no es ilimitada. El entrenamiento y el servicio de frontera dependen de chips avanzados, memoria de alto ancho de banda, redes, electricidad, refrigeración, terrenos, construcción y cadenas de suministro. La Agencia Internacional de Energía espera que la demanda eléctrica de los centros de datos aumente sustancialmente hasta 2030, aunque enfatiza la incertidumbre y una fuerte concentración geográfica (IEA, Energy and AI). Los retrasos en las redes eléctricas locales pueden importar incluso cuando la energía global es suficiente.

Los datos humanos de alta calidad también son finitos, aunque el efecto de esa restricción depende de nuevas fuentes de datos, entrenamiento multimodal, datos sintéticos y un uso más eficiente de los corpus existentes. Los límites económicos pueden llegar antes que los técnicos: un modelo más grande debe crear suficiente valor para justificar el entrenamiento, el servicio y los costos de oportunidad. La latencia y el ancho de banda de memoria pueden limitar los productos incluso cuando las operaciones agregadas están disponibles.

Los rendimientos decrecientes están integrados en el escalado. Una ley de potencia puede continuar mientras cada mejora adicional requiere mucho más gasto. Eso no significa que el progreso se detenga, pero cambia la economía. Una nueva arquitectura o algoritmo puede mover la curva, mientras que la seguridad, la fiabilidad o la corporeidad pueden requerir avances no capturados por la pérdida de predicción de siguiente token. Nadie puede establecer, solo a partir de las leyes de escalado actuales, dónde ocurrirán esos avances.

Por qué el cómputo sigue siendo una palanca de gobernanza

A pesar de estas salvedades, el cómputo avanzado es inusualmente físico y concentrado. Los chips de vanguardia se fabrican a través de una cadena de suministro global estrecha, y los clústeres de entrenamiento más grandes requieren capital, energía y redes visibles. Los gobiernos, por tanto, usan controles de exportación de chips, requisitos de reporte y reglas de centros de datos como aproximaciones de la capacidad de frontera. El cómputo puede ser más fácil de monitorear que los algoritmos o el software copiado.

La aproximación es imperfecta. Los umbrales pueden volverse obsoletos a medida que los algoritmos se vuelven más eficientes. El entrenamiento y la inferencia distribuidos complican la contabilidad. Una regla de cómputo puede cargar a la investigación legítima, arraigar a los grandes actores establecidos, o fomentar la evasión si está mal redactada. El cómputo de entrenamiento también pasa por alto sistemas capaces ensamblados mediante ajuste fino, uso de herramientas o muchas llamadas de inferencia. Una política eficaz debería actualizar los umbrales, tener en cuenta la eficiencia, proteger la privacidad y centrar las obligaciones en el riesgo en lugar de tratar las operaciones como daño.

La gobernanza del cómputo es más sólida cuando se combina con la evaluación de capacidades. El cómputo puede identificar ejecuciones que merecen escrutinio; las evaluaciones pueden probar si un sistema resultante cruza un umbral de capacidad peligrosa; el monitoreo de despliegue puede revelar el mal uso y los fallos. Ninguna métrica única debería soportar toda la carga regulatoria.

El escalado no resuelve los plazos de la AGI

La inversión rápida es evidencia de que los desarrolladores esperan retornos de sistemas más grandes y eficientes. El escalado histórico es evidencia de que los recursos adicionales a menudo han mejorado el rendimiento medido. Ninguno de los dos demuestra una fecha para la AGI. Los pronósticos deben modelar el hardware, la energía, los datos, los algoritmos, la inferencia, la fiabilidad y la propia definición de AGI.

Las afirmaciones de que “el escalado se ha detenido” requieren especificar qué métrica y sistema. Las afirmaciones de que “el escalado es todo lo que se necesita” requieren mostrar que las brechas restantes son reducibles a la misma tendencia. Entre esos eslóganes se encuentra la posición defendible: las leyes de escalado están entre las regularidades empíricas más útiles de la IA moderna, pero predicen promedios dentro de regímenes mejor de lo que predicen las consecuencias sociales cualitativas.

Qué deberían preguntar los lectores

Cuando un nuevo modelo se atribuye a la escala, hay que preguntar qué recurso aumentó, en cuánto, y contra qué línea base. ¿La comparación fue óptima en cómputo? ¿Cambiaron los datos o los algoritmos? ¿La ganancia reportada es en la pérdida de entrenamiento, una prueba de referencia, trabajo de expertos, o un resultado desplegado? ¿Cómo se veían la fiabilidad y el costo? ¿Los resultados son reproducibles de forma independiente?

Esas preguntas preservan la lección real de las leyes de escalado sin convertirla en mitología. Más cómputo ha permitido repetidamente mejores modelos. Es un insumo industrial importante y un punto práctico de supervisión. No es una unidad universal de inteligencia, una garantía de comportamiento seguro, ni una cuenta regresiva hacia la AGI.

References

  1. Kaplan et al. arxiv.org
  2. Hoffmann et al. arxiv.org
  3. Schaeffer, Miranda y Koyejo, 2023 arxiv.org
  4. IEA, Energy and AI iea.org

Type to search the manual.

navigate open esc close