{"id":20614,"date":"2026-09-13T22:05:18","date_gmt":"2026-09-13T22:05:18","guid":{"rendered":"https:\/\/www.fkeilers.com\/?p=20614"},"modified":"2026-09-13T22:49:13","modified_gmt":"2026-09-13T22:49:13","slug":"que-me-ensenaron-2-302-amazon-reviews-sobre-competencia-evidencia-y-estar-equivocado","status":"publish","type":"post","link":"https:\/\/www.fkeilers.com\/es\/que-me-ensenaron-2-302-amazon-reviews-sobre-competencia-evidencia-y-estar-equivocado\/","title":{"rendered":"Qu\u00e9 me ense\u00f1aron 2.302 Amazon Reviews sobre competencia, evidencia y estar equivocado"},"content":{"rendered":"<p class=\"PDq2pG_selectionAnchorContainer\" data-start=\"809\" data-end=\"1346\">La idea no empez\u00f3 con inteligencia artificial. Empez\u00f3 mientras buscaba una pregunta para mi proyecto final de Data Analytics &amp; AI y me encontr\u00e9 con un post sobre el crecimiento de los vendedores independientes en Amazon. All\u00ed se mencionaba que, en 2023, m\u00e1s de 10.000 vendedores independientes hab\u00edan superado por primera vez el mill\u00f3n de d\u00f3lares en ventas y que, para 2025, esa cifra hab\u00eda crecido hasta m\u00e1s de 75.000; el mismo material se\u00f1alaba adem\u00e1s un crecimiento del 36% durante el \u00faltimo a\u00f1o.<\/p>\n<p data-start=\"1348\" data-end=\"1803\">Lo que me llam\u00f3 la atenci\u00f3n no fue solamente el tama\u00f1o de Amazon ni la magnitud de esas cifras. Detr\u00e1s de cada vendedor que consigue crecer en un entorno as\u00ed hay una empresa intentando comprender suficientemente bien a sus clientes, su producto y a quienes compiten por la misma compra. Llegar a una posici\u00f3n relevante es dif\u00edcil; conservarla cuando el cliente puede comparar precios, productos y experiencias en segundos probablemente lo sea todav\u00eda m\u00e1s.<\/p>\n<p data-start=\"1805\" data-end=\"2208\">Amazon ofrec\u00eda adem\u00e1s un contexto dif\u00edcil de ignorar. Miles de productos compiten delante del mismo cliente, las diferencias de precio son visibles y las alternativas est\u00e1n a un clic. Debajo de cada producto ocurre algo todav\u00eda m\u00e1s interesante: cientos o miles de personas explican, con sus propias palabras, qu\u00e9 valoran, qu\u00e9 las decepcion\u00f3, qu\u00e9 funcion\u00f3, qu\u00e9 fall\u00f3 y por qu\u00e9 volver\u00edan \u2014o no\u2014 a comprar.<\/p>\n<blockquote>\n<p data-start=\"2210\" data-end=\"2541\"><strong data-start=\"2210\" data-end=\"2541\">Toda esa informaci\u00f3n est\u00e1 disponible. El problema empieza cuando dejamos de leer diez o veinte opiniones y queremos comprender miles de ellas de forma consistente. En ese momento, las reviews dejan de ser simplemente comentarios individuales y empiezan a parecerse a una fuente potencial de customer y competitive intelligence.<\/strong><\/p>\n<\/blockquote>\n<p data-start=\"2543\" data-end=\"3036\">Mi primera idea pod\u00eda haberse quedado en un ejercicio de <em data-start=\"2600\" data-end=\"2620\">sentiment analysis<\/em>, algo razonable dentro de un programa de Data Analytics &amp; AI. Sin embargo, cuanto m\u00e1s pensaba en el problema, menos me interesaba saber simplemente si una review era positiva o negativa. Lo que quer\u00eda entender era si esas opiniones pod\u00edan ayudar a identificar <strong data-start=\"2881\" data-end=\"2997\">d\u00f3nde una marca parec\u00eda ganar, d\u00f3nde parec\u00eda perder y con qu\u00e9 nivel de evidencia pod\u00eda sostenerse esa conclusi\u00f3n<\/strong>.<\/p>\n<p data-start=\"3038\" data-end=\"3529\">Ese cambio termin\u00f3 modificando el proyecto. El objetivo dej\u00f3 de ser utilizar una tecnolog\u00eda y pas\u00f3 a ser construir una forma defendible de convertir lenguaje desestructurado de clientes en informaci\u00f3n que pudiera aportar contexto a una decisi\u00f3n. La pregunta central termin\u00f3 siendo bastante sencilla de formular: <strong data-start=\"3350\" data-end=\"3529\">si una marca compitiera en este segmento, \u00bfd\u00f3nde estar\u00eda ganando y d\u00f3nde estar\u00eda perdiendo frente a sus competidores directos seg\u00fan lo que los propios clientes est\u00e1n diciendo?<\/strong><\/p>\n<p data-start=\"3531\" data-end=\"3761\">Pero hab\u00eda una segunda parte de la pregunta que terminar\u00eda siendo todav\u00eda m\u00e1s importante: \u00bfc\u00f3mo distinguir una se\u00f1al competitiva real de una diferencia que simplemente parece interesante porque apareci\u00f3 en una determinada muestra?<\/p>\n<h2 data-section-id=\"1eg00dx\" data-start=\"3763\" data-end=\"3806\"><span role=\"text\"><strong data-start=\"3766\" data-end=\"3806\">Llevar la pregunta a un mercado real<\/strong><\/span><\/h2>\n<p data-start=\"3808\" data-end=\"4346\">Para comprobarlo necesitaba dejar de hablar de \u201cproductos\u201d y \u201ccompetidores\u201d en abstracto. Eleg\u00ed el segmento de aud\u00edfonos premium <em data-start=\"3937\" data-end=\"3947\">over-ear<\/em> con cancelaci\u00f3n activa de ruido y utilic\u00e9 a Sennheiser como marca ancla frente a Bose, Sony, Bang &amp; Olufsen y Bowers &amp; Wilkins. La elecci\u00f3n de Sennheiser ten\u00eda adem\u00e1s una conexi\u00f3n con el contexto desde el que desarrollaba el proyecto: su sede se encuentra en Wedemark, cerca de Hannover, y la compa\u00f1\u00eda naci\u00f3 vinculada a la ingenier\u00eda desarrollada en la regi\u00f3n.<\/p>\n<p data-start=\"4348\" data-end=\"4803\">Sennheiser no fue un cliente real. Ninguna de las cinco compa\u00f1\u00edas encarg\u00f3, particip\u00f3 o fue informada del an\u00e1lisis; se trat\u00f3 originalmente de mi proyecto final del Weiterbildung y posteriormente continu\u00e9 refin\u00e1ndolo como pieza profesional de portfolio. Utilizar una empresa y un mercado reales permit\u00eda formular mejor la pregunta, pero no convert\u00eda un proyecto acad\u00e9mico en una experiencia comercial que nunca ocurri\u00f3.<\/p>\n<p data-start=\"4805\" data-end=\"5249\">La fuente fue <a href=\"https:\/\/amazon-reviews-2023.github.io\" target=\"_blank\" rel=\"noopener\"><strong data-start=\"4819\" data-end=\"4842\">Amazon Reviews 2023<\/strong><\/a>, el dataset p\u00fablico desarrollado por McAuley Lab en UC San Diego. A partir de la categor\u00eda Electronics constru\u00ed un corpus espec\u00edfico para las l\u00edneas premium de las cinco marcas, aplicando filtros de producto y un precio m\u00ednimo de 150 d\u00f3lares. Despu\u00e9s de la limpieza y de eliminar diez duplicados estrictos, el conjunto final qued\u00f3 formado por <strong data-start=\"5186\" data-end=\"5210\">2.302 reviews reales<\/strong>.<\/p>\n<p data-start=\"5251\" data-end=\"5811\">Llegar a esas 2.302 reviews fue menos trivial de lo que parec\u00eda. Una primera versi\u00f3n de los filtros lleg\u00f3 a clasificar productos AKG como si fueran Sennheiser, mientras que otro filtro demasiado amplio produjo 1.154 coincidencias para Sony, algo poco cre\u00edble si el objetivo era estudiar \u00fanicamente su l\u00ednea premium ANC. El dataset cubre muchos a\u00f1os de productos y un criterio demasiado gen\u00e9rico puede terminar mezclando art\u00edculos que contienen la palabra correcta pero que no pertenecen realmente al mismo competitive set.<\/p>\n<p data-start=\"5813\" data-end=\"6298\">La soluci\u00f3n fue abandonar los filtros generales y trabajar con l\u00edneas concretas: Momentum para Sennheiser, QuietComfort para Bose, WH-1000X para Sony y las correspondientes familias para las dem\u00e1s marcas. No fue la parte t\u00e9cnicamente m\u00e1s sofisticada del proyecto, pero termin\u00f3 siendo una de las decisiones m\u00e1s importantes. <strong data-start=\"6136\" data-end=\"6298\">Si la realidad que estamos midiendo est\u00e1 mal definida, ninguna sofisticaci\u00f3n posterior rescata el an\u00e1lisis; s\u00f3lo nos permite equivocarnos con mayor precisi\u00f3n.<\/strong><\/p>\n<h2 data-section-id=\"9vvoen\" data-start=\"6300\" data-end=\"6360\"><span role=\"text\"><strong data-start=\"6303\" data-end=\"6360\">Antes de dejar que la AI analizara miles de opiniones<\/strong><\/span><\/h2>\n<p data-start=\"6362\" data-end=\"6723\">Una vez construido el corpus aparec\u00eda una pregunta inc\u00f3moda. Un modelo de lenguaje pod\u00eda interpretar miles de reviews mucho m\u00e1s r\u00e1pido que yo, pero velocidad y confiabilidad no son lo mismo. Si la parte central del sistema iba a depender de la interpretaci\u00f3n de una AI, necesitaba alguna forma de comprobar primero qu\u00e9 tan cerca estaba de una evaluaci\u00f3n humana.<\/p>\n<p data-start=\"6725\" data-end=\"7170\">Seleccion\u00e9 una muestra de 200 reviews, 40 por marca, y las etiquet\u00e9 manualmente. Cada una fue evaluada por su sentimiento general y por siete dimensiones del producto: calidad de sonido, cancelaci\u00f3n de ruido, bater\u00eda, comodidad, dise\u00f1o y construcci\u00f3n, relaci\u00f3n calidad-precio y software\/conectividad. Ese conjunto se convirti\u00f3 en el <em data-start=\"7058\" data-end=\"7072\">ground truth<\/em>contra el cual pod\u00edan evaluarse posteriormente los modelos.<\/p>\n<p data-start=\"7172\" data-end=\"7721\">El propio proceso de etiquetado hizo que el dise\u00f1o evolucionara. Inicialmente hab\u00eda definido seis aspectos, pero comenzaron a aparecer suficientes comentarios sobre Bluetooth, firmware, aplicaciones y conectividad como para dejar claro que estaba ignorando una dimensi\u00f3n relevante de la experiencia del cliente. Software\/connectivity se convirti\u00f3 entonces en la s\u00e9ptima categor\u00eda, no porque necesitara a\u00f1adir otra variable al dashboard, sino porque las reviews mostraban que mi esquema inicial era incompleto.<\/p>\n<p data-start=\"7723\" data-end=\"8313\">Despu\u00e9s compar\u00e9 dos modelos \u2014Llama 3.3 70B y GPT-OSS 120B\u2014 contra las mismas 200 reviews. Antes de ejecutar el <em data-start=\"7834\" data-end=\"7844\">bake-off<\/em> establec\u00ed los criterios que determinar\u00edan si un modelo era suficientemente bueno, incluyendo error frente al juicio humano, precisi\u00f3n de polaridad, inversiones severas de sentimiento y nivel de acuerdo en la detecci\u00f3n de aspectos. Definir esas reglas antes de conocer el resultado no era un detalle metodol\u00f3gico menor: evitaba que el criterio pudiera acomodarse posteriormente alrededor del modelo que resultara m\u00e1s conveniente.<\/p>\n<blockquote>\n<p data-start=\"8315\" data-end=\"8504\"><strong data-start=\"8315\" data-end=\"8504\">Si decides qu\u00e9 significa \u201csuficientemente bueno\u201d despu\u00e9s de conocer los resultados, ya no est\u00e1s solamente evaluando. Tambi\u00e9n corres el riesgo de racionalizar aquello que quieres elegir.<\/strong><\/p>\n<\/blockquote>\n<p data-start=\"8506\" data-end=\"8983\">Los dos modelos superaron los criterios obligatorios y la comparaci\u00f3n estad\u00edstica entre ellos produjo un p-value de 0,757. En otras palabras, no hab\u00eda evidencia suficiente para declarar un ganador estad\u00edstico. Eso convirti\u00f3 la decisi\u00f3n en algo m\u00e1s interesante: si ambos eran suficientemente buenos para la tarea, hab\u00eda que considerar tambi\u00e9n velocidad, confiabilidad operativa, comportamiento en casos ambiguos y costo real de ejecuci\u00f3n.<\/p>\n<p data-start=\"8985\" data-end=\"9551\">Llama 3.3 70B termin\u00f3 siendo el modelo seleccionado. GPT-OSS presentaba un mejor acuerdo en detecci\u00f3n de aspectos, pero Llama fue aproximadamente tres veces m\u00e1s r\u00e1pido por review, necesit\u00f3 menos reintentos de schema y mostr\u00f3 un mejor comportamiento en determinados casos neutrales. Incluso el argumento econ\u00f3mico tuvo que corregirse: una lectura inicial suger\u00eda una diferencia de costo considerable, pero al contabilizar input y output completos la ventaja real de GPT-OSS era de apenas siete centavos sobre las 2.302 reviews.<\/p>\n<p data-start=\"9553\" data-end=\"9845\">Aquella correcci\u00f3n fue peque\u00f1a en t\u00e9rminos econ\u00f3micos, pero importante en t\u00e9rminos de m\u00e9todo. El proyecto empezaba a establecer una pauta: las decisiones iniciales pod\u00edan cambiar cuando aparec\u00eda mejor evidencia, y documentar esa correcci\u00f3n era preferible a preservar una narrativa m\u00e1s limpia.<\/p>\n<h2 data-section-id=\"1b5jwht\" data-start=\"9847\" data-end=\"9905\"><span role=\"text\"><strong data-start=\"9850\" data-end=\"9905\">Cuando los datos contradicen una historia razonable<\/strong><\/span><\/h2>\n<p data-start=\"9907\" data-end=\"10380\">Con el modelo seleccionado proces\u00e9 las 2.302 reviews y constru\u00ed las comparaciones entre marcas. All\u00ed apareci\u00f3 uno de los momentos que m\u00e1s terminaron definiendo el proyecto, porque una de mis hip\u00f3tesis iniciales parec\u00eda bastante razonable: Sennheiser tiene una identidad fuertemente vinculada con ingenier\u00eda y calidad de audio, mientras que Bang &amp; Olufsen y Bowers &amp; Wilkins poseen una presencia m\u00e1s visible alrededor del dise\u00f1o, los materiales y el posicionamiento premium.<\/p>\n<p data-start=\"10382\" data-end=\"10881\">Esperaba, por tanto, encontrar una divisi\u00f3n relativamente clara entre esos territorios. Pero dentro de la muestra analizada, Sennheiser presentaba el porcentaje m\u00e1s alto de menciones relacionadas con dise\u00f1o y comodidad entre las cinco marcas. En lugar de confirmar que estaba cediendo ese espacio a competidores m\u00e1s asociados con dise\u00f1o, las reviews mostraban que sus propios clientes hablaban de esa dimensi\u00f3n con mayor frecuencia de lo que hab\u00eda anticipado.<\/p>\n<p data-start=\"10883\" data-end=\"11236\">Era un hallazgo descriptivo, no una prueba causal ni una comparaci\u00f3n estad\u00edstica formal, pero bastaba para responder la hip\u00f3tesis tal como hab\u00eda sido formulada. <strong data-start=\"11044\" data-end=\"11236\">La idea inicial era razonable. Tambi\u00e9n estaba equivocada. Y esa diferencia \u2014entre tener una hip\u00f3tesis razonable y tener evidencia para sostenerla\u2014 terminar\u00eda siendo central en el proyecto.<\/strong><\/p>\n<p data-start=\"11238\" data-end=\"11574\">Un segundo resultado fue todav\u00eda m\u00e1s instructivo. Sennheiser aparec\u00eda con el puntaje promedio m\u00e1s alto en calidad de sonido, exactamente el tipo de resultado que encajaba con la reputaci\u00f3n de la marca y con la narrativa de ingenier\u00eda que rodeaba el caso. Era claro, intuitivo y favorable a la compa\u00f1\u00eda que hab\u00eda elegido como referencia.<\/p>\n<p data-start=\"11576\" data-end=\"11999\">Precisamente por eso necesitaba someterlo al mismo est\u00e1ndar utilizado para los resultados desfavorables. Cuando calcul\u00e9 los intervalos de confianza mediante bootstrap, la ventaja frente a Bose dej\u00f3 de sostenerse: el intervalo cruzaba el cero. Sennheiser segu\u00eda mostrando el promedio m\u00e1s alto, pero la evidencia ya no permit\u00eda defender que existiera una ventaja estad\u00edstica en sonido.<\/p>\n<blockquote>\n<p data-start=\"12001\" data-end=\"12264\"><strong data-start=\"12001\" data-end=\"12264\">La conclusi\u00f3n correcta era m\u00e1s modesta: con esta muestra y este nivel de incertidumbre, no exist\u00eda evidencia suficiente para afirmar que Sennheiser superara a sus competidores en calidad de sonido. El hallazgo m\u00e1s atractivo era tambi\u00e9n el que deb\u00eda abandonar.<\/strong><\/p>\n<\/blockquote>\n<p data-start=\"12266\" data-end=\"12598\">No considero que aquello debilitara el proyecto. Al contrario, fue uno de los momentos en los que el an\u00e1lisis comenz\u00f3 a demostrar algo m\u00e1s \u00fatil que la capacidad de producir resultados. Si aplicamos rigor \u00fanicamente cuando los datos contradicen aquello que queremos creer, el rigor deja de ser un m\u00e9todo y se convierte en decoraci\u00f3n.<\/p>\n<h2 data-section-id=\"1xlv8bt\" data-start=\"12600\" data-end=\"12641\"><span role=\"text\"><strong data-start=\"12603\" data-end=\"12641\">Lo que s\u00ed sobrevivi\u00f3 al escrutinio<\/strong><\/span><\/h2>\n<p data-start=\"12643\" data-end=\"13085\">Otros resultados s\u00ed resistieron la revisi\u00f3n. En cancelaci\u00f3n de ruido, Sennheiser presentaba el promedio m\u00e1s bajo de las cinco marcas y, m\u00e1s importante todav\u00eda, la brecha frente a Bose y Sony \u2014los dos referentes m\u00e1s fuertes de ANC dentro de esta muestra\u2014 se manten\u00eda estad\u00edsticamente significativa. Frente a Bang &amp; Olufsen y Bowers &amp; Wilkins, en cambio, la diferencia no pod\u00eda sostenerse del mismo modo.<\/p>\n<p data-start=\"13087\" data-end=\"13505\">La interpretaci\u00f3n correcta, por tanto, no era que Sennheiser estuviera \u201cpeor que toda la industria\u201d. Lo que los datos permit\u00edan afirmar era algo m\u00e1s espec\u00edfico: <strong data-start=\"13248\" data-end=\"13419\">en esta muestra, su percepci\u00f3n de ANC se encontraba aproximadamente en el mismo grupo que Bowers &amp; Wilkins y Bang &amp; Olufsen, pero claramente por debajo de Bose y Sony.<\/strong> Ese matiz cambia menos el titular que el significado, y precisamente por eso importa.<\/p>\n<p data-start=\"13507\" data-end=\"14001\">La bater\u00eda mostraba otra se\u00f1al. Sennheiser ocupaba tambi\u00e9n la \u00faltima posici\u00f3n por promedio, aunque la diferencia que puede afirmarse con seguridad como estad\u00edsticamente confirmada es la comparaci\u00f3n frente a Sony. Otras dimensiones presentaban resultados interesantes \u2014por ejemplo, relaci\u00f3n calidad-precio o software\/conectividad\u2014, pero no fueron sometidas al mismo conjunto de pruebas inferenciales y por eso deben permanecer como hallazgos descriptivos.<\/p>\n<blockquote>\n<p data-start=\"14003\" data-end=\"14340\"><strong data-start=\"14003\" data-end=\"14340\">\u201cTiene el promedio m\u00e1s alto\u201d no significa necesariamente \u201cposee una ventaja competitiva demostrada\u201d. Del mismo modo, \u201cocupa la \u00faltima posici\u00f3n\u201d no significa autom\u00e1ticamente \u201ces significativamente peor que todos los competidores\u201d. Aprender a preservar esa diferencia de lenguaje termin\u00f3 siendo tan importante como producir las cifras.<\/strong><\/p>\n<\/blockquote>\n<h2 data-section-id=\"1jaonb6\" data-start=\"14342\" data-end=\"14404\"><span role=\"text\"><strong data-start=\"14345\" data-end=\"14404\">Encontrar se\u00f1ales que desaparecen dentro de un promedio<\/strong><\/span><\/h2>\n<p data-start=\"14406\" data-end=\"14803\">El proyecto incorpor\u00f3 tambi\u00e9n una capa experimental destinada a detectar posibles anomal\u00edas de seguridad que pod\u00edan quedar invisibles dentro de cualquier promedio. Una incidencia aislada relacionada con sobrecalentamiento, una bater\u00eda o un problema el\u00e9ctrico dif\u00edcilmente mover\u00eda una m\u00e9trica agregada de satisfacci\u00f3n, pero eso no significa que carezca de relevancia para quien analiza el producto.<\/p>\n<p data-start=\"14805\" data-end=\"15206\">La primera versi\u00f3n del detector utilizaba palabras clave y produjo 37 candidatos. Muy pronto apareci\u00f3 el problema: en el lenguaje cotidiano de las reviews hab\u00eda expresiones perfectamente normales en audio, comodidad o emoci\u00f3n que activaban las reglas sin representar ning\u00fan incidente. El detector estaba encontrando palabras, pero no necesariamente significado.<\/p>\n<p data-start=\"15208\" data-end=\"15764\">Despu\u00e9s de exigir mayor contexto alrededor de esas palabras, los candidatos se redujeron a seis. Revis\u00e9 manualmente cada uno y tres correspond\u00edan realmente a se\u00f1ales que merec\u00edan atenci\u00f3n, mientras que los otros tres segu\u00edan siendo falsos positivos. En la versi\u00f3n p\u00fablica decid\u00ed no identificar las marcas relacionadas con esos incidentes, porque se trata de reviews individuales sin corroboraci\u00f3n externa y no existe base suficiente para convertirlas en una afirmaci\u00f3n general sobre la seguridad de ninguna compa\u00f1\u00eda.<\/p>\n<p data-start=\"15766\" data-end=\"16190\">Pero la experiencia revel\u00f3 una limitaci\u00f3n todav\u00eda m\u00e1s importante. Los falsos positivos son visibles porque el detector marca un caso y despu\u00e9s podemos comprobar que estaba equivocado; los falsos negativos son diferentes. Si una review describe un problema real utilizando palabras que las reglas no contemplan, simplemente no aparece entre los candidatos y no tenemos manera de saber cu\u00e1ntos casos as\u00ed pudieron quedar fuera.<\/p>\n<blockquote>\n<p data-start=\"16192\" data-end=\"16413\"><strong data-start=\"16192\" data-end=\"16413\">Una se\u00f1al puede ser demasiado peque\u00f1a para alterar un promedio y, aun as\u00ed, suficientemente importante como para merecer atenci\u00f3n. Pero detectar algo no significa haber demostrado su frecuencia, su causa ni su alcance.<\/strong><\/p>\n<\/blockquote>\n<p data-start=\"16415\" data-end=\"16505\">Ese l\u00edmite qued\u00f3 incorporado al roadmap en lugar de ocultarse como una debilidad inc\u00f3moda.<\/p>\n<h2 data-section-id=\"18fg56e\" data-start=\"16507\" data-end=\"16558\"><span role=\"text\"><strong data-start=\"16510\" data-end=\"16558\">Del hallazgo a la decisi\u00f3n hay una distancia<\/strong><\/span><\/h2>\n<p data-start=\"16560\" data-end=\"16889\">A medida que avanzaba el proyecto apareci\u00f3 otra pregunta que inicialmente no estaba tan presente: incluso suponiendo que el an\u00e1lisis hubiera identificado se\u00f1ales correctas, \u00bfqu\u00e9 deber\u00eda hacer realmente una empresa con ellas? La diferencia importa porque un an\u00e1lisis puede mejorar una decisi\u00f3n sin estar en condiciones de tomarla.<\/p>\n<p data-start=\"16891\" data-end=\"17509\">Si las reviews muestran una brecha consistente de percepci\u00f3n de ANC frente a Bose y Sony, un product manager podr\u00eda razonablemente decidir que vale la pena investigar el problema con mayor profundidad. Ser\u00eda muy distinto concluir, \u00fanicamente a partir de estas reviews, que la compa\u00f1\u00eda deber\u00eda redise\u00f1ar inmediatamente el hardware. Una decisi\u00f3n de ese tipo puede ser costosa y dif\u00edcil de revertir, y necesitar\u00eda triangular la se\u00f1al con informaci\u00f3n adicional como devoluciones, garant\u00edas, soporte al cliente, encuestas propias o investigaci\u00f3n de mercado con una muestra diferente.<\/p>\n<blockquote>\n<p data-start=\"17511\" data-end=\"17614\"><strong data-start=\"17511\" data-end=\"17614\">Las Amazon Reviews pueden ayudar a indicar d\u00f3nde mirar. No necesariamente pueden decidir qu\u00e9 hacer.<\/strong><\/p>\n<\/blockquote>\n<p data-start=\"17616\" data-end=\"18054\">Esa frontera termin\u00f3 siendo una de las partes m\u00e1s importantes del trabajo. Es f\u00e1cil pedirle a un an\u00e1lisis m\u00e1s autoridad de la que posee: los datos pueden reducir incertidumbre, revelar una anomal\u00eda, comparar alternativas o cuestionar una hip\u00f3tesis, pero eso no significa que una \u00fanica fuente p\u00fablica pueda reemplazar todo el contexto operativo, financiero, t\u00e9cnico y estrat\u00e9gico que una organizaci\u00f3n necesita para una decisi\u00f3n importante.<\/p>\n<p data-start=\"18056\" data-end=\"18318\">En ese sentido, el resultado m\u00e1s \u00fatil del proyecto no fue producir siete rankings. Fue aprender a separar con mayor precisi\u00f3n <strong data-start=\"18182\" data-end=\"18317\">lo que los datos permit\u00edan afirmar, lo que razonablemente pod\u00edan sugerir y aquello para lo cual todav\u00eda necesit\u00e1bamos m\u00e1s evidencia<\/strong>.<\/p>\n<h2 data-section-id=\"xvfbqj\" data-start=\"18320\" data-end=\"18378\"><span role=\"text\"><strong data-start=\"18323\" data-end=\"18378\">Lo que este proyecto demuestra \u2014y lo que todav\u00eda no<\/strong><\/span><\/h2>\n<p data-start=\"18380\" data-end=\"19017\">El proyecto termin\u00f3 recorriendo un proceso completo: definici\u00f3n del problema, exploraci\u00f3n y recolecci\u00f3n de datos, limpieza en SQL, construcci\u00f3n manual del <em data-start=\"18535\" data-end=\"18549\">ground truth<\/em>, evaluaci\u00f3n comparativa de modelos, procesamiento de las 2.302 reviews, pruebas estad\u00edsticas, an\u00e1lisis competitivo y comunicaci\u00f3n mediante un informe ejecutivo y un dashboard p\u00fablico. T\u00e9cnicamente segu\u00ed las seis fases de CRISP-DM y una arquitectura de datos bronze\/silver\/gold; Python, MySQL, modelos de lenguaje, estad\u00edstica y Tableau formaron parte del proceso, pero ninguno de ellos fue por s\u00ed solo el prop\u00f3sito del trabajo.<\/p>\n<p data-start=\"19019\" data-end=\"19565\">Tambi\u00e9n existen l\u00edmites importantes. Amazon es una sola fuente y el dataset utilizado termina en septiembre de 2023; el <em data-start=\"19139\" data-end=\"19153\">ground truth<\/em> fue etiquetado por un \u00fanico anotador; la poblaci\u00f3n total disponible es desconocida para cuatro de las cinco marcas; algunas l\u00edneas re\u00fanen distintas generaciones de producto y Sennheiser presenta una cobertura de precio incompleta dentro del dataset. Ninguno de esos elementos invalida autom\u00e1ticamente el an\u00e1lisis, pero s\u00ed condiciona cu\u00e1nto puede afirmarse a partir de \u00e9l.<\/p>\n<p data-start=\"19567\" data-end=\"20142\">Tampoco puedo afirmar todav\u00eda que el sistema funcione para cualquier categor\u00eda. Varias partes de la arquitectura fueron dise\u00f1adas para reutilizarse \u2014la conexi\u00f3n con distintos proveedores de AI, el patr\u00f3n de resiliencia, el protocolo de evaluaci\u00f3n de modelos, la capa estad\u00edstica y la preparaci\u00f3n de datos\u2014, pero el esquema de siete aspectos, el prompt y los filtros de productos pertenecen espec\u00edficamente al mercado de aud\u00edfonos. Cambiar de categor\u00eda exige volver a comprender qu\u00e9 importa medir antes de reutilizar la infraestructura.<\/p>\n<blockquote>\n<p data-start=\"20144\" data-end=\"20401\"><strong data-start=\"20144\" data-end=\"20401\">Por eso prefiero hablar de una arquitectura dise\u00f1ada para ser reutilizable, no de una reusabilidad ya demostrada. Existe una diferencia importante entre construir algo con la intenci\u00f3n de que pueda generalizarse y haber comprobado que realmente lo hace.<\/strong><\/p>\n<\/blockquote>\n<p data-start=\"20403\" data-end=\"20950\">Ese matiz tambi\u00e9n define lo que el proyecto representa hoy. Naci\u00f3 como trabajo final de un programa de Data Analytics &amp; AI y despu\u00e9s continu\u00f3 evolucionando como una pieza de portfolio y evidencia profesional. Se explor\u00f3 la posibilidad de llevarlo hacia un servicio comercial, pero la evaluaci\u00f3n posterior del mercado mostr\u00f3 que V1 no deb\u00eda comercializarse tal como estaba; su valor actual est\u00e1 en el trabajo realizado, la metodolog\u00eda, la evidencia producida y las preguntas que permite seguir desarrollando.<\/p>\n<h2 data-section-id=\"wo2qge\" data-start=\"20952\" data-end=\"21010\"><span role=\"text\"><strong data-start=\"20955\" data-end=\"21010\">V2: cambiar el contexto antes de ampliar el sistema<\/strong><\/span><\/h2>\n<p data-start=\"21012\" data-end=\"21451\">La siguiente iteraci\u00f3n seguir\u00e1 trabajando con Amazon Reviews. Cambiar\u00e1n, sin embargo, la categor\u00eda de producto y la marca utilizada como referencia; todav\u00eda no he decidido cu\u00e1les ser\u00e1n. El prop\u00f3sito de V2 no es a\u00f1adir nuevas plataformas ni convertir inmediatamente el proyecto en un sistema universal, sino comprobar qu\u00e9 sucede cuando la misma l\u00f3gica metodol\u00f3gica se enfrenta a un dominio diferente.<\/p>\n<p data-start=\"21453\" data-end=\"21895\">Eso significa volver a plantear preguntas que ahora parecen resueltas. \u00bfSigue funcionando adecuadamente el protocolo de validaci\u00f3n cuando cambian las dimensiones relevantes del producto? \u00bfQu\u00e9 partes de la arquitectura permanecen estables y cu\u00e1les necesitan redise\u00f1o? \u00bfLa separaci\u00f3n entre hallazgo, interpretaci\u00f3n y recomendaci\u00f3n contin\u00faa siendo suficientemente robusta cuando el lenguaje de los clientes y los problemas del mercado son otros?<\/p>\n<blockquote>\n<p data-start=\"21897\" data-end=\"22004\"><strong data-start=\"21897\" data-end=\"22004\">V2 no deber\u00eda demostrar que V1 ten\u00eda raz\u00f3n. Deber\u00eda poner a prueba qu\u00e9 partes de V1 merecen sobrevivir.<\/strong><\/p>\n<\/blockquote>\n<p data-start=\"22006\" data-end=\"22525\">Hay adem\u00e1s dos mejoras concretas ya identificadas. La primera es reemplazar el detector de alertas basado en keywords por una evaluaci\u00f3n contextual incorporada al an\u00e1lisis normal de cada review, atendiendo directamente a una de las limitaciones m\u00e1s claras de V1. La segunda es reorganizar el dashboard p\u00fablico para separar una vista de resumen de otra de detalle, de modo que un usuario pueda reconocer los principales hallazgos r\u00e1pidamente y profundizar s\u00f3lo cuando lo necesite.<\/p>\n<p data-start=\"22527\" data-end=\"23097\">Existe tambi\u00e9n una ambici\u00f3n posterior, pero pertenece a otra etapa. Una vez que la l\u00ednea Amazon Reviews V1\/V2 haya sido suficientemente desarrollada y cerrada, me interesa explorar si esta l\u00f3gica puede evolucionar hacia un sistema m\u00e1s amplio de customer &amp; competitive intelligence capaz de trabajar con reviews procedentes de otras fuentes, como Google Maps, Yelp o TripAdvisor. Eso exigir\u00eda resolver nuevos problemas de adquisici\u00f3n, estructura y comparabilidad de datos y todav\u00eda no existe una arquitectura definida para hacerlo.<\/p>\n<blockquote>\n<p data-start=\"23099\" data-end=\"23294\"><strong data-start=\"23099\" data-end=\"23294\">Esa posibilidad es una direcci\u00f3n futura, no una capacidad actual. V2 sigue siendo Amazon Reviews; la generalizaci\u00f3n multi-plataforma vendr\u00eda despu\u00e9s y tendr\u00eda que ganarse con nueva evidencia.<\/strong><\/p>\n<\/blockquote>\n<h2 data-section-id=\"y387w5\" data-start=\"23296\" data-end=\"23350\"><span role=\"text\"><strong data-start=\"23299\" data-end=\"23350\">Lo que me queda despu\u00e9s de 2.302 Amazon Reviews<\/strong><\/span><\/h2>\n<p data-start=\"23352\" data-end=\"23679\">Cuando empec\u00e9, la pregunta parec\u00eda estar relacionada con Amazon, sentiment analysis e inteligencia artificial. Despu\u00e9s de 2.302 reviews, dos modelos, siete dimensiones, varias hip\u00f3tesis y algunas conclusiones que tuve que abandonar, el aprendizaje que m\u00e1s me interesa conservar tiene menos que ver con una herramienta concreta.<\/p>\n<p data-start=\"23681\" data-end=\"24083\">La tecnolog\u00eda permiti\u00f3 procesar informaci\u00f3n a una escala que manualmente habr\u00eda sido dif\u00edcil abordar. La estad\u00edstica ayud\u00f3 a separar algunas se\u00f1ales del ruido. Pero ninguna de las dos elimin\u00f3 la necesidad de definir correctamente el problema, cuestionar una hip\u00f3tesis razonable, reconocer una limitaci\u00f3n o decidir que un resultado atractivo no ten\u00eda evidencia suficiente para convertirse en conclusi\u00f3n.<\/p>\n<blockquote>\n<p data-start=\"24085\" data-end=\"24257\"><strong data-start=\"24085\" data-end=\"24257\">Los datos son \u00fatiles cuando nos permiten ver algo que antes no ve\u00edamos. Se vuelven todav\u00eda m\u00e1s valiosos cuando nos obligan a dejar de ver algo que s\u00f3lo cre\u00edamos cierto.<\/strong><\/p>\n<\/blockquote>\n<p data-start=\"24259\" data-end=\"24472\">Quiz\u00e1 ah\u00ed est\u00e9 la parte del proyecto que m\u00e1s vale la pena conservar. No en haber construido un sistema que siempre encuentra respuestas, sino en haber construido uno que tambi\u00e9n puede obligarme a revisar las m\u00edas.<\/p>\n<hr data-start=\"24474\" data-end=\"24477\" \/>\n<p data-start=\"24479\" data-end=\"24863\"><em data-start=\"24479\" data-end=\"24823\">Este proyecto fue desarrollado originalmente como trabajo final de un programa de Data Analytics &amp; AI y posteriormente refinado como pieza profesional de portfolio. Utiliza el dataset p\u00fablico <a href=\"https:\/\/amazon-reviews-2023.github.io\" target=\"_blank\" rel=\"noopener\">Amazon Reviews 2023 de McAuley Lab<\/a>, UC San Diego. Sennheiser, Bose, Sony, Bang &amp; Olufsen y Bowers &amp; Wilkins no participaron ni encargaron el an\u00e1lisis.<\/em><\/p>\n<p data-start=\"24479\" data-end=\"24863\"><em>El estudio de caso completo, los detalles de la metodolog\u00eda y el tablero interactivo de este proyecto est\u00e1n disponibles en <a href=\"https:\/\/github.com\/FkEilers\/customer-competitive-intelligence-amazon-reviews-v1\" target=\"_blank\" rel=\"noopener\">GitHub<\/a> y <a href=\"https:\/\/public.tableau.com\/app\/profile\/fkeilers\/viz\/Customer_Competitive_Intelligence_Amazon_Reviews_V1\/00_Dashboard_Customer_Competitive_Intelligence_Amazon_Reviews_V1?publish=yes\" target=\"_blank\" rel=\"noopener\">Tableau Public<\/a>.<\/em><\/p>\n","protected":false},"excerpt":{"rendered":"<p>La idea no empez\u00f3 con inteligencia artificial. Empez\u00f3 mientras buscaba una pregunta para mi proyecto final de Data Analytics &amp; AI y me encontr\u00e9 con un post sobre el crecimiento de los vendedores independientes en Amazon. All\u00ed se mencionaba que, en 2023, m\u00e1s de 10.000 vendedores independientes hab\u00edan superado por primera vez el mill\u00f3n de d\u00f3lares en ventas y que, para 2025, esa cifra hab\u00eda crecido hasta m\u00e1s de 75.000; el mismo material se\u00f1alaba adem\u00e1s un crecimiento del 36% durante el \u00faltimo a\u00f1o. Lo que me llam\u00f3 la atenci\u00f3n no fue solamente el tama\u00f1o de Amazon ni la magnitud de esas cifras. Detr\u00e1s de cada vendedor que consigue crecer en un entorno as\u00ed hay una empresa intentando comprender suficientemente bien a sus clientes, su producto y a quienes compiten por la misma compra. Llegar a una posici\u00f3n relevante es dif\u00edcil; conservarla cuando el cliente puede comparar precios, productos y experiencias en segundos probablemente lo sea todav\u00eda m\u00e1s. Amazon ofrec\u00eda adem\u00e1s un contexto dif\u00edcil de ignorar. Miles de productos compiten delante del mismo cliente, las diferencias de precio son visibles y las alternativas est\u00e1n a un clic. Debajo de cada producto ocurre algo todav\u00eda m\u00e1s interesante: cientos o miles de personas [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[819],"tags":[],"class_list":["post-20614","post","type-post","status-publish","format-standard","hentry","category-caso-de-estudio"],"_links":{"self":[{"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/posts\/20614","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/comments?post=20614"}],"version-history":[{"count":4,"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/posts\/20614\/revisions"}],"predecessor-version":[{"id":20618,"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/posts\/20614\/revisions\/20618"}],"wp:attachment":[{"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/media?parent=20614"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/categories?post=20614"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.fkeilers.com\/es\/wp-json\/wp\/v2\/tags?post=20614"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}