三段式模型堆疊
結合三種模型類型:與佈局及語言無關的 encoder、單一語言 ContextLM,以及特定佈局的 decoder,以提高準確度。
FUTO Swipe 是一項滑動輸入研究版,結合資料集、模型堆疊與 C++ 解碼庫,可將滑動軌跡轉為文字預測。適合用於建立、評估與研究滑動輸入系統,並提供 QWERTY 英文解碼器與 HuggingFace 上的 MIT 授權資料集。
FUTO Swipe 是一項滑動輸入研究與模型發布,重點在於將手繪鍵盤路徑轉成文字預測。此專案結合了已發布的資料集、訓練完成的模型與解碼函式庫,讓滑動輸入能夠被評估並用於推論流程。
網站描述了一個由三部分組成的模型堆疊:通用 encoder、單一語言 ContextLM,以及特定佈局的 decoder。搭配受字典限制的 beam search,這些元件旨在提升滑動預測品質,同時維持模型規模足以在低階裝置上執行。
此專案源自 2024 年 8 月在 swipe.futo.org 上進行的資料集蒐集工作。該工作產生了超過 100 萬筆滑動輸入,並於 2025 年 3 月在 HuggingFace 以 MIT 授權發布一份清理後的 100 萬筆滑動資料集。
FUTO Swipe 也發布了 swipe-library,一個用於推論、解碼與 beam search 的 C++ 函式庫。網站將其定位為把滑動軌跡轉換成排序候選字詞所欠缺的關鍵一環。
結合三種模型類型:與佈局及語言無關的 encoder、單一語言 ContextLM,以及特定佈局的 decoder,以提高準確度。
encoder 提供跨佈局與語言的一般滑動預測,而 decoder 則針對特定佈局與語言訓練,以捕捉鍵盤特有行為。
ContextLM 使用前文句子脈絡來抑制不合理的字詞序列,且訓練時只需要文字資料。
受字典限制的 beam search 會根據滑動路徑為候選字詞打分,因為原始模型輸出本身並不足夠。
此發布包含 swipe-library,一個負責從滑動路徑到文字預測之推論、解碼與 beam search 的 C++ 函式庫。
網站報告已發布一個包含 100 萬筆英文 QWERTY 滑動輸入的資料集,並以 MIT 授權,用於模型訓練與評估。
使用已發布的資料集與模型說明,研究滑動輸入系統、比較不同方法,或在受控的英文 QWERTY 語料上重現評估。
在建立或測試需要從原始手勢路徑進行候選排序的滑動轉文字流程時,一併使用 encoder、ContextLM 與 decoder。
當你需要模型輸出外層的解碼與 beam search 層,而不只是輸出分數的原始模型時,使用 swipe-library。
使用已發布資源來理解脈絡、佈局知識與特定佈局訓練,對預測品質各自帶來多少貢獻。
在目標裝置或環境中,毫秒級推論與低運算量很重要時,使用這套小型模型堆疊。
來源將 Swipe 描述為一套滑動輸入系統,由已發布的滑動資料集、訓練模型與用於將路徑解碼為文字預測的 C++ swipe-library 組成。
頁面說目前發布的解碼器僅支援 QWERTY 英文,因為解碼器訓練需要特定佈局與語言的滑動輸入資料。
網站表示該資料集已在 MIT 授權下發布,並可於 HuggingFace 取得。
模型被描述為足以在低階裝置上以毫秒級執行,而網站也表示完整堆疊會使用受字典限制的 beam search 產生候選字詞。
頁面未列出消費者應用程式、SDK 或代管 API;它將模型與 swipe-library 呈現為用於滑動轉文字預測工作流程的已發布資源。