ASL 指拼识别
从摄像头输入中实时识别美国手语指拼字母表,覆盖 A 到 Z。
signspell 是一款用于从摄像头实时识别美国手语指拼的 Python 包。它聚焦于手动字母表,可实时识别 A–Z,并通过精致的屏幕界面展示结果。
该项目结合了 MediaPipe 手部追踪和基于 30 帧关键点序列训练的 LSTM 模型。它内置预训练模型,既可通过命令行使用,也可作为可导入的库使用,适合希望进行基于实时摄像头识别而非离线图像分类的用户。
从摄像头输入中实时识别美国手语指拼字母表,覆盖 A 到 Z。
根据项目说明,使用 MediaPipe 手部追踪和基于 30 帧关键点序列训练的 LSTM 模型。
包含预训练模型和精致的摄像头界面,因此无需先自行接入模型即可运行。
可作为命令行工具使用,提供摄像头选择、置信度阈值、镜像视图控制和自定义模型路径等选项。
可作为库导入,`signspell.run()` 用于完整界面,`Recognizer` 用于程序化逐帧预测。
使用 30 帧滚动缓冲区和短暂稳定窗口,帮助在字母确认前减少闪烁。
从终端运行 signspell,使用默认摄像头或指定的摄像头索引识别指拼字母,并可按需调整置信度阈值或镜像模式。
在 Python 应用中导入该包并调用 `signspell.run()`,将完整摄像头界面嵌入你的工作流。
在你希望自行处理帧并在代码中处理预测字母时,结合 OpenCV 帧捕获使用 `Recognizer` 类。
当你已有与预期输入和输出形状匹配的兼容模型时,可用自定义 `.h5` 文件替换内置模型。
将该包用于无障碍演示、课堂示例或原型,其中实时 ASL 手动字母识别是主要交互方式。
它提供命令行界面和可导入的 Python 库。CLI 可以使用默认摄像头或指定摄像头,库则暴露 `signspell.run()` 以及用于逐帧预测的 `Recognizer` 类。
项目说明写明,它需要 Python 3.9–3.11,并且需要摄像头进行实时识别。
来源说明它可实时识别美国手语指拼字母表(A–Z),并包含一个稳定性窗口,以减少字母确认前的闪烁。
PyPI 显示该项目采用 MIT License (MIT)。
你可以使用 `--model path/to/your_model.h5` 或 `Recognizer(model_path=...)` 指向自定义模型。来源说明该模型必须接受输入形状 `(1, 30, 63)`,并输出 26 个类别分数。