Joshua Stancle dirige Clean Saint desde Los Ángeles. El producto es una película para el cuidado lingual sin agua. La empresa es él. Utiliza IA para depósito, marketing, expansión web y atención al cliente, y cuando le preguntamos cómo se siente, lo expresó de esta guisa: “En cierto sentido, soy diez”.
Sigo volviendo a la segunda fracción de esa frase. Si sois diez, necesitáis alguna forma de conocer si los otros nueve están haciendo correctamente el trabajo.
La veterano parte de la conversación sobre IA todavía viaje en torno a una sola pregunta. ¿Qué maniquí es el mejor? Para una empresa, esa es la dispositivo de medida incorrecta. Un maniquí razona. Comercio significa aldabear a un proveedor, presentar un formulario de aduanas, perseguir un contenedor que perdió su buque, dirigir una devolución, y un maniquí no hace cero de eso por sí solo. El trabajo lo realiza un agente: el maniquí que piensa, un arnés que le proporciona herramientas, memoria y capacidad de proceder, y un contexto que le indica cómo es un buen resultado en una industria específica. En Alibaba.com, ese contexto proviene de 27 abriles de observar cómo se desarrolla en realidad el comercio completo.
Lo que el trabajo comercial le pide a un agente
La industria se ha vuelto muy buena en evaluar la inteligencia. Los puntos de relato cubren el razonamiento, la codificación, las matemáticas, el retentiva de hechos y, cada vez más, el uso de herramientas. Pero el trabajo comercial vivo es poco más complicado que todo eso. El depósito parece sencillo por escrito. En la maña, significa comparar docenas de cotizaciones, detectar una inconsistencia oculta en la cuarta página de una hoja de especificaciones, ojear los términos de suscripción con suficiente atención para notar cuándo han cambiado silenciosamente y confirmar que la término de entrega prometida sobrevive al contacto con su cronograma de remesa.
Anuncio
Anuncio
Los listados de productos tienen la misma textura. Los atributos tienen que ser correctos. Las categorías tienen que ser correctas. Es posible que la misma cotización deba cumplir un conjunto de requisitos reglamentarios en Alemania y un conjunto diferente en California. Los resultados plausibles tienen aquí muy poco valencia. El trabajo tiene que terminarse, correctamente, en el sistema donde vive.
Probar a un agente de IA sólo en lo que dice es como clasificar a los pilotos en un examen escrito sin pedirles que aterricen el avión.
Encuadrar el resultado
Es por eso que el equipo de Accio en Alibaba.com, que ofrece un agente de inteligencia químico creado para el comercio completo, desarrolló una prueba que califica los resultados. CommerceAgentBench es de código rajado y está arreglado en GitHub. Contiene 107 tareas integrales extraídas de operaciones reales de comercio electrónico en adquisiciones, abastecimiento, relación de productos, cumplimiento y servicio posventa.
Los reunimos a partir de lo que pudimos ver en nuestros propios datos: 10 millones de usuarios activos de pequeñas empresas, 1,6 millones de conversaciones reales y 200.000 seguimientos de ejecución, clasificados en siete categorías de trabajo comercial.
Anuncio
Anuncio
La calificación ocurre en el estado final. La directorio se publicó con los atributos correctos o no. La carga se mueve en una ruta que ya existe, o permanece en un terminal en Ningbo mientras determinado averigua qué salió mal.
El comercio siempre ha llevado la puntuación de esta guisa. Un cliente que recibe el producto erróneo no tiene interés en cuán suelto sonó el agente cuando realizó el pedido. La ejecución es el punto de relato que importa.
lo que encontramos
El maniquí de frontera más esforzado que probamos se completó con éxito 61,7% de las tareas.
Esa guarismo es lo suficientemente reincorporación como para ser útil y lo suficientemente quebranto como para ser una advertencia. El trabajo comercial de varios pasos que hasta hace poco estaba fuera del gravedad de la automatización ahora se completa la veterano parte del tiempo. Pero cerca de cuatro de cada diez tareas todavía resultaron mal.
Anuncio
Anuncio
Los fracasos se concentraron en lugares reconocibles. Los agentes lucharon por detectar una anomalía de suscripción escondida interiormente de un espléndido hilo de correo electrónico de un proveedor, el tipo de cosa que se revela como fraude sólo luego de que determinado ha erudito los 300 mensajes. El costo final les dio problemas una vez que el cálculo involucraba varias variables móviles a la vez. Las disputas posventa fracasaron cuando la respuesta requirió conciliar documentos que no estaban de acuerdo entre sí. Las rutas marítimas de varios tramos eran siempre difíciles.
Cada uno de estos sucede miles de veces al día en empresas reales.
El aventura cambia a medida que aumenta la admisión. En miles de empresas que utilizan agentes similares, los errores individuales podrían convertirse en errores correlacionados: los listados inexactos podrían multiplicarse, las señales de fraude podrían pasarse por stop y los errores de enrutamiento o cumplimiento podrían afectar las cadenas de suministro. La medición muestra dónde la automatización está directorio para medrar y dónde la supervisión humana aún debe seguir el ritmo.
Un resultado me sorprendió más que el número del titular. Ningún maniquí ganó. Liderazgo rotado por categoría. El maniquí que ocupó el primer zona en trabajo de solicitud de cotizaciones e investigación de mercado quedó a espaldas en resolución de reclamos y cumplimiento de cotizaciones, donde lideraba un maniquí diferente. Un tercero fue más esforzado en la publicación de productos y el manejo de devoluciones. Una clasificación elaborada a partir de puntuaciones de razonamiento universal le dice muy poco sobre qué sistema funcionará en una tarea comercial particular, razón por la cual la disyuntiva del maniquí pertenece al trabajo.
Delegación de precisión
Para una empresa individual, ese aventura más amplio se traduce en una pregunta maña: la pregunta que vale la pena plantearse es más estrecha que la que discute la industria. ¿Qué flujos de trabajo puedo entregar ahora y cuáles todavía me necesitan? Un punto de relato que califica los resultados rebate exactamente a eso. Cuando las tasas de aprobación son altas, la comparación de proveedores y el trabajo rutinario de relación pueden salir de su escritorio. Cuando sean bajos, en cuestiones de cumplimiento inusuales y negociaciones complicadas y las excepciones que constituyen más de cualquier operación comercial de lo que nadie prórroga, mantenga a una persona informada y verifique el trabajo.
Anuncio
Anuncio
A esto lo llamo delegación de precisión. Una vez que sabes dónde es confiable un agente, puedes dejar de supervisarlo, y una vez que sabes dónde descompostura, puedes detectar la descompostura antaño que el cliente. Entreambos ahorran peculio. Ningún de los dos está arreglado sin medida.
El comercio necesita una prueba como esta y todo lo demás incluso. La abastecimiento tiene sus propios casos extremos, al igual que las finanzas, la manufactura, la medicina y los servicios legales. Cada campo necesitará un punto de relato construido por personas que entiendan lo que cuesta un mal resultado allí, y esos puntos de relato deben ser abiertos, de modo que un comprador pueda comparar el propaganda de un proveedor con poco.
La autoridad se trasladará a los agentes un flujo de trabajo a la vez, a medida que cada uno la gane. Joshua tiene diez de él ahora. Lo que necesita a continuación es una forma de conocer cuál de los diez puede dejar de comprobar.
Las opiniones expresadas en los comentarios de Fortune.com son sólo los puntos de perspicacia de sus autores y no reflejan necesariamente las opiniones y creencias de Fortuna.
Esta historia apareció originalmente en Fortune.com



