Uso del reconocimiento de voz dentro de un ascensor
Por Eleftherios Parageorgiou, Nikolaos Stratigakis y Lazaros Asvestopoulos | Sistemas de Comunicación | Junio 1, 2015
10 minuto de lectura
talk2lift es un dispositivo de reconocimiento de voz para cabinas de ascensores que convierte comandos hablados en pulsaciones de teclas para la selección de piso, lo que permite un control multilingüe e independiente del hablante sin necesidad de capacitación del usuario. Diseñado para entornos ruidosos, utiliza un procesador de señal digital (DSP) integrado y un servidor central que recopila grabaciones ambientales para entrenar algoritmos de supresión de ruido y reconocimiento, y enviar actualizaciones. El sistema ofrece síntesis de voz y confirmación visual, admite hasta 10 000 comandos predefinidos, incluyendo nombres o palabras clave asociadas a los pisos, se integra con los controladores de ascensores y la telefonía de emergencia, y no requiere mantenimiento mecánico. Las pruebas realizadas en la torre de pruebas de KLEEMANN demostraron una alta precisión, mejorando la accesibilidad y la navegación en edificios complejos.
Este trabajo fue presentado en
París 2014, el Congreso Internacional de Tecnologías de Transporte Vertical, y publicado por primera vez en el libro de la IAEE Tecnología de ascensores 20, editado por A. Lustig. Es una reimpresión con permiso de la Asociación Internacional de Ingenieros de Ascensores.
(sitio web: www.elevcon.com). Este artículo es una reimpresión exacta y no ha sido editado por ELEVATOR WORLD.
Palabras clave: tecnología de reconocimiento de voz, ascensor controlado por voz, industria de ascensores, talk2lift®
RESUMEN
En las últimas décadas hubo varios desarrollos en la industria de los ascensores en cuanto a seguridad, velocidad, pero también economía y conveniencia. La única tarea era hacer que el uso de los ascensores fuera más eficiente, más fácil y más accesible para un número cada vez mayor de personas. En esta dirección, el reconocimiento de voz tiene un impacto significativo en los problemas de accesibilidad, al mismo tiempo que proporciona una forma más rápida de encontrar y llegar a un destino, dentro de un edificio complejo. El presente documento aborda el fundamento del desarrollo de un producto innovador que utiliza tecnología de voz, lo que brinda la oportunidad del surgimiento de la primera serie de ascensores controlados por voz en la historia de la industria de los ascensores.
1. INTRODUCCIÓN
El presente documento describe una invención relacionada con un ascensor en el que se puede especificar el destino de los pasajeros mediante reconocimiento de voz. Su objetivo es presentar la justificación, el contexto de fondo y el proceso de desarrollo del producto denominado hablar2lift®. Además, el documento aborda las principales implicaciones para los ingenieros de ascensores, instaladores e industrias relacionadas con ascensores. Finalmente, el trabajo analiza brevemente las principales perspectivas comerciales del producto. Este documento está organizado en cuatro secciones principales. La primera sección examina los antecedentes y la justificación de la innovación. La segunda sección analiza la función de la innovación enfatizando sus características y capacidades innovadoras. En la siguiente sección se examinan las implicaciones prácticas y el uso de la innovación, mientras que en la última se resumen los elementos principales del artículo centrándose en los principales aspectos críticos del producto.
2. JUSTIFICACIÓN DE LA INNOVACIÓN
En general, un ascensor está provisto de botones para especificar un número de piso. Un usuario-pasajero en el ascensor puede especificar un número de piso deseado presionando el botón del número de piso.
Se proporcionan dos juegos de botones de números de piso dentro de un elevador en caso de un elevador de gran escala. Además, los ciegos sufren el inconveniente de tener que buscar a tientas los botones para encontrar el tipo Braille. Aunque ya existen sistemas de reconocimiento de voz que permiten a los usuarios dar comandos de voz usando solo su voz, tienen una limitación significativa que es la capacidad de rechazar el ruido ambiental, lo que resulta en una tasa relativamente baja de reconocimiento exitoso de comandos.
Todo lo anterior se trata de la innovación de talk2lift®. Esta invención se refiere a un dispositivo de reconocimiento de voz, que cabe en la consola de la cabina de un ascensor y mediante comandos de voz se puede dirigir al usuario-pasajero del ascensor al destino deseado dentro del edificio. El motor de reconocimiento de voz está diseñado y desarrollado de tal manera que no necesita entrenamiento en la voz de un usuario-pasajero, pero puede reconocer y ejecutar todos los comandos de voz de diferentes usuarios. Brevemente, la función principal de la invención es convertir los comandos de voz en las correspondientes pulsaciones de teclas del ascensor. Más allá de esta función básica, el dispositivo talk2lift®, siempre que haya una interfaz con el controlador principal de los ascensores, también puede recopilar información sobre el funcionamiento de los ascensores y enviarlos a una ubicación central para su posterior procesamiento. El sistema se puede conectar a una pantalla en la cabina del ascensor, que presentará datos adicionales para informar mejor al usuario-pasajero, de acuerdo con los comandos de voz que haya dado.
Finalmente, el sistema puede entrenarse continuamente en grabaciones de ruido ambiental, las almacena en una base de datos y las distribuye a todos los usuarios, de modo que todos los sistemas instalados se entrenan continuamente para reconocer y rechazar el ruido y mejorar aún más la calidad del reconocimiento de voz.
2.1 Función talk2lift®
La presente invención se comprende completamente a partir de la descripción detallada del diseño, tal como se ilustra en la Figura 1. Al ingresar un usuario-pasajero a la cabina del ascensor, se activa el sensor de presencia (véase la Figura 1, punto 8). A continuación, el sensor envía una señal al procesador central (véase la Figura 1, punto 4), que a su vez activa el micrófono (véase la Figura 1, punto 1) y la unidad de reconocimiento de voz (véase la Figura 1, punto 10), iniciando así el proceso de reconocimiento del comando de voz del usuario-pasajero. Durante este proceso, el sistema le solicita al usuario-pasajero que indique su destino mediante una frase específica: «Por favor, dígame el piso» o «Por favor, dígame su destino».
Tras la respuesta del usuario del ascensor, el micrófono (véase la figura 1, punto 1) convierte la voz en una señal eléctrica. A continuación, el convertidor analógico-digital (véase la figura 1, punto 2) convierte la señal analógica en digital. Una vez digitalizada, el procesador de señal digital (véase la figura 1, punto 3) procesa la señal digital para que esté lista para su entrada en la unidad central de procesamiento (véase la figura 1, punto 4) y, posteriormente, en la unidad de reconocimiento de voz (véase la figura 1, punto 10).
Cuando la unidad de reconocimiento de voz recibe la señal digitalizada, la compara con una lista de comandos preexistente almacenada en la unidad de memoria (véase la Figura 1, punto 5). Una vez identificado el comando, se envía la señal correspondiente al procesador central (4), que lo transmite al controlador del ascensor (véase la Figura 1, punto 7). Como confirmación para el usuario, un sintetizador de voz (Figura 1, punto 9) repite el comando reconocido. Además, el sistema puede proporcionar una confirmación visual al usuario a través de la pantalla (Figura 1, punto 12).
En caso de interrupción del suministro eléctrico, el procesador central detecta la interrupción y activa el siguiente procedimiento: El sintetizador de voz (véase la figura 1, punto 9) pregunta al usuario si necesita comunicarse con el servicio de emergencia correspondiente (por ejemplo, bomberos, policía, etc.). A continuación, se activa la unidad de reconocimiento de voz (véase la figura 1, punto 10). Si la respuesta es afirmativa, el procesador central (véase la figura 1, punto 4) permite que la unidad se conecte a la red telefónica (véase la figura 1, punto 6) y esta, a su vez, llama al servicio correspondiente.
2.2 Algoritmo de cancelación de ruido y reconocimiento de voz
La función más importante de talk2lift® es su capacidad para interactuar con el usuario a través del reconocimiento y la síntesis de voz. Obviamente, el problema más difícil en esta comunicación es reconocer la voz del usuario y no confundirse por la variedad de ruido electromagnético que emerge en un sistema de ascensor. Por lo tanto, es necesario utilizar un algoritmo de supresión de ruido para la cancelación de ruido. Desafortunadamente, el ruido audible está bien capturado por las teorías de la distribución gaussiana normal.
Como resultado de este ruido, la mayoría de los algoritmos (desarrollados bajo el supuesto de Gauss) no proporcionan los resultados esperados o colapsan por completo debido a la presencia del ruido de choque.
La innovación principal radica en el uso de un servidor central que recopila muestras de comandos reconocidos del usuario, en diversos entornos con ruido ambiental. Las grabaciones recibidas por el servidor se utilizan para entrenar el algoritmo. Los resultados del entrenamiento se comparten con los dispositivos de los usuarios para que contengan los parámetros más actualizados del algoritmo. Este algoritmo se diseña e implementa en un lenguaje de alto nivel. Posteriormente, se optimiza para cumplir con los requisitos de tiempo de ejecución y memoria del sistema final. Finalmente, se escribe en aritmética de punto fijo, compatible con los procesadores de procesamiento digital de señales (DSP) disponibles.
Para desarrollar un algoritmo de supresión de ruido, se requirió el diseño, desarrollo e implementación de una placa de reconocimiento de voz especializada. Esta placa incluye las herramientas e interfaces adecuadas para probar diversas técnicas, circuitos, algoritmos e interfaces. Además, incluye los circuitos apropiados para el procesamiento de señales digitales para probar varios algoritmos de reconocimiento de voz y supresión de ruido. También está equipado con las interfaces apropiadas (interfaces) para interactuar con otros circuitos, instrumentos de medición, grabadoras, micrófonos, entradas de varios sensores, etc., y la computadora host para cargar algoritmos. Esta placa ha sido diseñada por un grupo de investigación, especializado y experimentado en tecnologías de reconocimiento de voz.
3. FUNCIONES Y USO INNOVADORES
talk2lift® lleva el poder del reconocimiento de voz en cualquier cabina de ascensor, lo que permite a los pasajeros controlar el ascensor por voz. talk2lift® permite a los usuarios pronunciar el número de piso o cualquier otra información relacionada (propietario de la casa, profesión, sector / área, etc.). Por último, admite el funcionamiento multilingüe.
talk2lift® es un dispositivo electrónico de reconocimiento de voz ajustable en el tablero electrónico de la cabina de un ascensor. Mediante el uso de la tecnología del habla, los pasajeros pueden hablar con el ascensor pronunciando el piso al que desean ir dentro de un edificio o incluso el nombre de la persona que desean visitar o algunos atributos que los caracterizan (por ejemplo, dermatólogo). El sistema de software del reconocimiento de voz ha sido diseñado y desarrollado para reconocer la voz de cualquier usuario, independientemente del tono o volumen de su voz. En resumen, la función principal de Talk & Lift es transformar la voz de los usuarios del ascensor en una pulsación adicional del botón en el tablero de un ascensor. Finalmente, talk2lift® se puede conectar a una pantalla cercana al tablero de un ascensor, en la que los usuarios pueden ver información adicional como los pisos seleccionados junto con cualquier información disponible públicamente para el sistema (por ejemplo, ocupación). Más allá de esta función básica, el dispositivo talk2lift®, siempre que haya una interfaz con el controlador principal de los ascensores, también puede recopilar información sobre el funcionamiento de los ascensores y enviarlos a una ubicación central para su posterior procesamiento.
Las principales capacidades de talk2lift® son las siguientes:
- El proceso de reconocimiento del sistema es independiente del hablante, lo que significa que el usuario no tiene que entrenar el sistema con su voz.
- Capacidad de reconocer hasta 10,000 comandos de voz predefinidos.
- El sistema ha sido desarrollado y entrenado para un mejor uso en el entorno de una cabina de ascensor.
- El sistema está diseñado de manera que se pueda conectar a cualquier sistema de ascensor sin necesidad de modificaciones de hardware.
- El sistema puede manejar más de un idioma. Por ejemplo, el sistema puede equiparse con dos botones, uno para el idioma inglés y otro para el alemán.
- El sistema está disponible en los siguientes idiomas: alemán, inglés, francés, portugués, español, holandés, griego, italiano, polaco, portugués, sueco, turco, ruso, finlandés, danés, chino mandarín.
3.1 Implicaciones y uso indicativo
talk2lift® tiene muchas implicaciones prácticas. En primer lugar, la cabina tiene un “botón adicional” que, al presionarlo, solicita a los pasajeros que pronuncien su destino. De este modo, los usuarios pueden utilizar el ascensor de forma convencional, lo que permite una fase de transición. El botón adicional (ver foto 2) está especialmente diseñado para que sea accesible tanto para usuarios de sillas de ruedas como para personas con discapacidad visual. Los pasajeros pueden ser trasladados al piso deseado con solo pronunciarlo (por ejemplo, “-primer piso”, “planta baja” o “estacionamiento”).
Es posible pronunciar el nombre de una persona o una empresa (por ejemplo, "Jim Brown") o cualquier otra palabra que se ha correlacionado con un piso (por ejemplo, "oficina de impuestos", "abogado", "departamento de cardiología", " café").
En resumen, talk2lift® se puede utilizar como una gran ayuda para las personas con discapacidad visual que pueden recibir apoyo en sus accesos y destinos. Además, los habitantes y visitantes de los edificios pueden tener un acceso fácil y rápido a apartamentos, oficinas, etc. Además, puede ofrecer un ahorro de tiempo para los visitantes en grandes edificios (oficinas, hospitales, servicios públicos, etc.) mejorando la precisión y reduciendo los defectos. de moverse dentro del edificio. Por último, talk2lift® es un sistema respetuoso con el medio ambiente, ya que ahorra energía mediante la aplicación de prácticas de sistemas de gestión inteligentes.
El uso indicativo del sistema podría apuntar a edificios de apartamentos, números de pisos de apoyo y nombres de propietarios o inquilinos. Además, se puede instalar en edificios complejos que albergan oficinas de empresas, vinculados con palabras clave que asocian pisos con nombres de empresas, marcas, productos, nombres de empleados, sectores, etc.
Por último, talk2lift® es una herramienta útil para ascensores en grandes organizaciones públicas o privadas con muchos pisos y departamentos, como hospitales, en los que los edificios suelen albergar decenas de departamentos y clínicas.
4. CONCLUSIONES
La necesidad de un sistema de reconocimiento de voz sólido y confiable se conoce comúnmente desde hace años entre los profesionales de los ascensores.
El uso indicativo del sistema podría apuntar a edificios de apartamentos, edificios complejos que albergan oficinas de empresas y grandes organizaciones con muchos pisos y departamentos, como hospitales. talk2lift® se puede utilizar como una gran ayuda para las personas con discapacidad visual que pueden recibir apoyo en sus accesos y destinos. Asimismo, los habitantes y visitantes de los edificios pueden tener un acceso fácil y rápido a apartamentos, oficinas, etc.
La necesidad era evidente y también lo eran los diversos usos explicados. El producto se diseñó en consecuencia para cubrir todas esas necesidades y se probó minuciosamente en la torre de pruebas de KLEEMANN, donde se instaló unos meses antes de su lanzamiento. Durante esos meses el producto estaba siendo utilizado en condiciones reales por empleados y visitantes de KLEEMANN y no mostraba ninguna inexactitud.
En resumen, talk2lift® tiene las siguientes características innovadoras:
- Es independiente de la voz, funciona para nuevos pasajeros sin necesidad de formación previa.
- Proporciona una precisión mejorada para cabinas de ascensor con tasas de precisión de hasta el 97%.
- Proporciona un control central y dinámico de las asociaciones de palabras clave a los pisos a través de una interfaz de usuario intuitiva.
- Agrega valor tanto al ascensor como al edificio al dar una sensación de lujo y tecnología de alta gama.
- No necesita mantenimiento mecánico.
- Es personalizable para adaptarse a necesidades específicas.
