signspell logo

signspell

认领

signspell 是一款用于从摄像头实时识别美国手语指拼的 Python 包,支持命令行使用和可导入的库 API,内置模型与摄像头界面。

signspell preview

概述

signspell 是一款用于从摄像头实时识别美国手语指拼的 Python 包。它聚焦于手动字母表,可实时识别 A–Z,并通过精致的屏幕界面展示结果。

该项目结合了 MediaPipe 手部追踪和基于 30 帧关键点序列训练的 LSTM 模型。它内置预训练模型,既可通过命令行使用,也可作为可导入的库使用,适合希望进行基于实时摄像头识别而非离线图像分类的用户。

功能

ASL 指拼识别

从摄像头输入中实时识别美国手语指拼字母表,覆盖 A 到 Z。

基于序列的识别流程

根据项目说明,使用 MediaPipe 手部追踪和基于 30 帧关键点序列训练的 LSTM 模型。

内置模型与界面

包含预训练模型和精致的摄像头界面,因此无需先自行接入模型即可运行。

CLI 控制

可作为命令行工具使用,提供摄像头选择、置信度阈值、镜像视图控制和自定义模型路径等选项。

库 API

可作为库导入,`signspell.run()` 用于完整界面,`Recognizer` 用于程序化逐帧预测。

缓冲输出处理

使用 30 帧滚动缓冲区和短暂稳定窗口,帮助在字母确认前减少闪烁。

使用场景

  • 实时摄像头识别

    从终端运行 signspell,使用默认摄像头或指定的摄像头索引识别指拼字母,并可按需调整置信度阈值或镜像模式。

  • 嵌入式界面使用

    在 Python 应用中导入该包并调用 `signspell.run()`,将完整摄像头界面嵌入你的工作流。

  • 逐帧程序化推理

    在你希望自行处理帧并在代码中处理预测字母时,结合 OpenCV 帧捕获使用 `Recognizer` 类。

  • 自定义模型集成

    当你已有与预期输入和输出形状匹配的兼容模型时,可用自定义 `.h5` 文件替换内置模型。

  • 交互式 ASL 演示

    将该包用于无障碍演示、课堂示例或原型,其中实时 ASL 手动字母识别是主要交互方式。

Pros and Cons

Pros

  • 可从摄像头输入中实时识别 ASL 手动字母表。
  • 同时提供 CLI 和库两种使用方式,适配不同工作流。
  • 开箱即用,附带预训练模型和界面。
  • 支持自定义模型路径,方便用户替换自己的模型。
  • 记录了摄像头选择、阈值、镜像和键盘控制等具体运行行为。

Cons

  • 实时识别需要摄像头。
  • 源代码将支持的 Python 版本限制为 3.9–3.11。
  • 项目说明除了安装和基础 CLI/库示例外,没有提供更详细的设置说明。

FAQ

我该如何使用 signspell?

它提供命令行界面和可导入的 Python 库。CLI 可以使用默认摄像头或指定摄像头,库则暴露 `signspell.run()` 以及用于逐帧预测的 `Recognizer` 类。

运行需要什么条件?

项目说明写明,它需要 Python 3.9–3.11,并且需要摄像头进行实时识别。

它能识别什么?

来源说明它可实时识别美国手语指拼字母表(A–Z),并包含一个稳定性窗口,以减少字母确认前的闪烁。

signspell 使用什么许可证?

PyPI 显示该项目采用 MIT License (MIT)。

我可以使用自己的模型吗?

你可以使用 `--model path/to/your_model.h5` 或 `Recognizer(model_path=...)` 指向自定义模型。来源说明该模型必须接受输入形状 `(1, 30, 63)`,并输出 26 个类别分数。

Quick Facts

类别
开发者工具
包名
signspell
平台
Python 3.9–3.11
主要输入
摄像头视频
许可证
MIT License (MIT)
来源域名
pypi.org