La evaluación de modelos es específica de cada tarea
Las pruebas de referencia solo miden el alcance evaluado; no demuestran el rendimiento general.
El éxito de un modelo pequeño no implica capacidad general
Que un modelo pequeño supere el umbral de una tarea no implica nada sobre otras tareas.
Filtración de datos de evaluación y defectos en los conjuntos de datos
El entrenamiento y la evaluación pueden heredar o amplificar defectos y fugas de los conjuntos de datos; la calidad de los datos sigue siendo una responsabilidad compartida.
La ejecución local no garantiza la seguridad
La ejecución local reduce la exposición por salida de datos, pero por sí sola no hace que un sistema sea seguro.
Las rutas de respaldo pueden aumentar la exposición
Recurrir a un modelo externo más grande amplía el cruce del límite; las vías alternativas necesitan el mismo examen de políticas que las rutas principales.
Los conectores de canales dependen de las plataformas
Los conectores de conversación de Axon dependen de los controles y la disponibilidad de plataformas externas.
Los agentes humanos son un límite
Las personas que atienden conversaciones derivadas siguen formando parte del límite de confianza.
La ejecución distribuida no es una tecnología de privacidad
Mantener los ejemplos sin procesar y los corpus en su ubicación reduce lo que cruza el límite. No es agregación segura, privacidad diferencial, computación confidencial ni protección de conocimiento cero, y las métricas o los fragmentos que sí cruzan pueden seguir entrañando riesgos de inferencia.
Los resultados agregados pueden ocultar fallos locales
Una métrica global puede cumplir los criterios mientras un entorno obligatorio falla. La evaluación distribuida está diseñada para mantener ese fallo visible y suspender la promoción; un resultado agregado por sí solo no determina la puesta en producción.
Las capacidades distribuidas están previstas
La evaluación distribuida privada y la recuperación distribuida controlada son arquitecturas previstas en la hoja de ruta. Ninguna está implementada ni disponible actualmente en pruebas piloto.