Base de Conocimiento ANE
EN ES

Apple Neural Engine · optimización de transformers

Apple Neural Engine

Una guía de campo para optimizar modelos transformer con inferencia on-device en Apple silicon.

La ANE es un acelerador FP16, channels-first, cuyos búferes exigen que el último eje del tensor sea contiguo y esté alineado a 64 bytes, admite como máximo tensores 5D, paga costes reales por reshapes y transposiciones, y suele estar limitado por ancho de banda con lotes pequeños. Esta base de conocimiento traza —desde la investigación de Apple de 2022 hasta el stack Core AI de 2026— qué significa eso exactamente para los transformers, con experimentos ejecutables medidos en Apple silicon real.

Capítulos

  1. 01 Apple Neural Engine (ANE): Visión general y restricciones de hardware Qué es la ANE y las restricciones de hardware que guían cada optimización: layout 4D channels-first, alineación a 64 bytes, FP16, máximo 5D, copias de memoria y régimen bandwidth-bound.
  2. 02 Los cuatro principios para optimizar Transformers en el ANE Los cuatro principios de Apple con código real: layout BC1S + Linear→Conv2d 1×1, chunking por cabeza + split softmax, minimizar copias con einsum y manejar el límite de ancho de banda.
  3. 03 Caso de estudio: Optimizar DistilBERT de Hugging Face para el ANE Adaptar un modelo de terceros sin reentrenar: el patrón subclase-y-sustitución, hooks del state-dict, higiene FP16 y resultados medidos (hasta 10× en latencia, 14× en memoria).
  4. 04 Despliegue de Vision Transformers basados en atención en la ANE DeiT vs MOAT, atención por ventana local, la partición 'relay' de ventanas ≤5D, NHWC vs NCHW, split softmax y diseño de embeddings posicionales (RPE / RPE de una cabeza / LePE).
  5. 05 Flujo de despliegue: PyTorch → Core ML → ANE Pipeline de extremo a extremo: PyTorch → torch.jit.trace → coremltools (ML Program) → informes de rendimiento de Xcode, con una checklist de errores para reproducir los exports de Apple.
  6. 06 Caso de estudio: WhisperKit — ASR en producción sobre la ANE (Argmax) ASR de producción en la ANE: modelos multicomponente, estrategias SDPA intercambiables, decodificación con KV-cache y shapes estáticas, MLState, LUTs de context-prefill y verificación en CI.
  7. 07 Compresión de modelos para la ANE: palettization, recetas mixed-bit, outlier decomposition Palettización, perfilado de sensibilidad por capa y recetas mixed-bit, descomposición dispersa de outliers — la compresión como optimización de latencia en regímenes bandwidth-bound.
  8. 08 Cronología de WWDC: la evolución de Core ML 2022–2025 La línea de tiempo oficial de la plataforma: informes de rendimiento (2022), compresión con ct.optimize (2023), modelos stateful / MLTensor / SDPA fusionado (2024) y la meseta de 2025.
  9. 09 Core AI (WWDC26): el nuevo stack de inferencia on-device de Apple El nuevo stack de inferencia de Apple: .aimodel, especialización + compilación AOT, la API Swift, coreai-torch / coreai-opt / coreai-models, y cómo sobreviven los principios ANE de 2022.
  10. 10 Core ML vs Core AI: una comparación lado a lado Comparación lado a lado: trace vs export, quién posee la optimización, linaje del KV-cache, la compilación que se mueve 'a la izquierda', la verificación como producto — y un mapa de migración.
  11. 11 Práctica: reproduciendo el pipeline de conversión de WhisperKit El doc 06 reproducido de verdad en un M4 Pro: whisper-tiny → Core ML, PSNR 42–69 dB, 99–100% de despacho a la ANE en los troncos, y nuestro benchmark medido ANE-vs-CPU.
  12. 12 Comparación práctica: pipelines de exportación WhisperKit/Core ML vs Core AI Mismo modelo, misma máquina, ambos pipelines ejecutados: ~50× menos código de autoría con coreai-torch, tamaños de artefacto que convergen y la pregunta de compute-unit resuelta empíricamente.
  13. 13 Core AI Agent Skills: el manual de ANE de Apple, legible por máquinas El manual ANE de Apple como agent skills: la convención K@Q, −40000 vs −inf, 'no fused SDPA path', reglas de stride, la bifurcación KV readonly-vs-stateful y las firmas de fallo por PSNR.

Sobre esta base de conocimiento

Trece documentos, cada uno trazable a una fuente: un artículo de Apple ML Research, una sesión de la WWDC, una página oficial o un archivo de las implementaciones de referencia. Los capítulos prácticos reproducen los pipelines en un Apple M4 Pro (macOS 26.5.1) y reportan evidencia medida.