Компания Apple представила результаты своего исследования, посвященного тому, как большие языковые модели (LLM) могут анализировать аудиоданные и данные о движении для понимания действий пользователей. Научная работа под названием «Использование LLM для последующего объединения мультимодальных данных датчиков для распознавания активности» подчеркивает потенциал интеграции ИИ и традиционных данных от датчиков для улучшения анализа активности, особенно когда одних данных недостаточно. Исследователи использовали данные Ego4D, содержащие записи из реального мира, для классификации различных действий, таких как уборка, занятия спортом и отдых. Результаты показали, что LLM способны эффективно определять действия пользователей, даже без специального обучения. При наличии одного примера для обучения точность возрастает. Модели Gemini-2.5-pro и Qwen-32B продемонстрировали высокую точность в идентификации активности, особенно в закрытых наборах данных. Это исследование открывает новые горизонты для создания более умных и адаптивных мобильных систем.