Audio8 ASR 是一个无限流语音识别模型,它采用原生流式架构,每秒解码12.5次。它使用滚动的KV缓存,即使在全天候运行的情况下也能保持内存和延迟的稳定。每时钟步长生成一个文本标记(相当于每秒12.5 / 8.3 / 6.25次决策),平衡感知粒度和资源成本。一个实习生在HuggingChat中设置了一个Gradio工作流来尝试这个模型:HuggingChat模型:
—— AK (@_akhaliq) X帖子|2026-09-30T03:32:55+00:00
原帖:https://x.com/_akhaliq/status/2105138799147982883
AK:Audio8 ASR 是一个无限流语音识别模型,它采用原生流…
Audio8 ASR 是一个无限流语音识别模型,它采用原生流式架构,每秒解码12.5次。它使用滚动的KV缓存,即使在全天候运行的情况下也能保持内存和延迟的稳定。每时钟步长生成一个文本标记(相当于每秒12.5 / 8.3 / 6.25次决策)
扫描二维码,在手机上阅读
