百度360必应搜狗淘宝本站头条
当前位置:网站首页 > IT技术 > 正文

Dify工作流实现语音转文字-纯本地模型

wptr33 2025-06-15 19:46 22 浏览

语音转文字(Speech-to-Text, STT)技术的应用越来越广泛,从会议记录到视频字幕生成,STT 技术为我们的生活和工作带来了极大的便利。今天,我将介绍如何使用 Dify 实现语音转文字,具体流程包括上传音频文件、通过 Flask 接口调用 FunASR 模型进行语音识别,最终将生成的文字返回到 Dify 端。全部过程都是本地运行,不依赖其他第三方工具。

视频演示:

演示

1.什么是FunASR?

FunASR 是一个高性能的语音识别工具包,基于 PyTorch 和 Kaldi 构建,支持多种语言和方言,具有高准确率和低延迟的特点。

2.下载FunASR模型

pip install modelscope
modelscope download --model iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-pytorch --local_dir D:\downloads\AIModels\FunASR

推荐使用Paraformer语音识别-中文-通用-16k-离线-large-pytorch这个,也就是我们下载的
iic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-pytorch ,下载好后如下图:

3.下载源码安装依赖

git clone https://github.com/modelscope/FunASR.git

cd源码根目录,然后安装依赖,注意python要>=3.8

pip install -e ./
pip install torch torchaudio --index-url https://download.pytorch.org/whl/cu118

4.然后测试一下,自己拿手机随便录个音

我照着红框里的文本读了几句,写一个简单的测试代码

from funasr import AutoModel
from funasr.utils.postprocess_utils import rich_transcription_postprocess

model_dir = "D:/downlaods/AIModels/FunASR"

model = AutoModel(
    model=model_dir,
    vad_model="fsmn-vad",
    vad_kwargs={"max_single_segment_time": 30000},
    device="cuda:0",
)

# en
res = model.generate(
    input=f"D:/workspaces/py_work_space/diyf-api/1.mp3",
    cache={},
    language="auto",  # "zn", "en", "yue", "ja", "ko", "nospeech"
    use_itn=True,
    batch_size_s=60,
    merge_vad=True,  #
    merge_length_s=15,
)
text = rich_transcription_postprocess(res[0]["text"])
print(text)

注意:model_dir指向模型保存的目录,而不是某个具体的文件,这个目录下有很多文件,经过测试mp3和wav格式都支持。运行一下看结果还不错。

5.用flask写一个http服务

因为我们要集成到dify中,所以需要一个后台的http服务。接收从dify上传过来的音频文件,然后转成文字后再返回给dify。代码如下:

from flask import Flask, request, jsonify
from funasr import AutoModel
from funasr.utils.postprocess_utils import rich_transcription_postprocess
import os

app = Flask(__name__)

model_dir = "D:/downlaods/AIModels/FunASR"

model = AutoModel(
    model=model_dir,
    vad_model="fsmn-vad",
    vad_kwargs={"max_single_segment_time": 30000},
    device="cuda:0",
)

@app.route('/transcribe', methods=['POST'])
def transcribe():
    # 获取上传的音频文件
    if 'audio' not in request.files:
        return jsonify({'error': 'No audio file provided'}), 400

    audio_file = request.files['audio']
    if audio_file.filename == '':
        return jsonify({'error': 'No selected file'}), 400

    # 保存上传的音频文件
    temp_audio_path = "temp_audio.mp3"
    audio_file.save(temp_audio_path)

    # 调用 FunASR 模型进行语音识别
    res = model.generate(
        input=temp_audio_path,
        cache={},
        language="auto",  # "zn", "en", "yue", "ja", "ko", "nospeech"
        use_itn=True,
        batch_size_s=60,
        merge_vad=True,
        merge_length_s=15,
    )

    # 后处理识别结果
    text = rich_transcription_postprocess(res[0]["text"])

    # 删除临时文件
    os.remove(temp_audio_path)

    # 返回结果
    return jsonify({'text': text})

if __name__ == '__main__':
    app.run(debug=True)

写好以后启动这个程序,然后用接口工具测试一下,正常返回。

6.Dify集成

在Dify里创建一个工作流,起名TTS

开始节点添加一个文件上传框

然后增加一个http请求节点,按照接口工具里的配置一下:注意键名是 audio,和后台接口参数一致,值就是开始节点上传框,我这里都是叫 audio,并且如果dify是用docker部署的,url要用host.docker.internal来访问外部的宿主机。

最后添加一个结束节点,输出变量就是http请求节点的body,即后台的相应内容:

整个工作流如下,发布运行测试一下:

以上就用Dify通过本地STT模型集成了语音转文字的操作。想要完整代码和工作流的小伙伴关注私信获取。

相关推荐

MySQL进阶五之自动读写分离mysql-proxy

自动读写分离目前,大量现网用户的业务场景中存在读多写少、业务负载无法预测等情况,在有大量读请求的应用场景下,单个实例可能无法承受读取压力,甚至会对业务产生影响。为了实现读取能力的弹性扩展,分担数据库压...

Postgres vs MySQL_vs2022连接mysql数据库

...

3分钟短文 | Laravel SQL筛选两个日期之间的记录,怎么写?

引言今天说一个细分的需求,在模型中,或者使用laravel提供的EloquentORM功能,构造查询语句时,返回位于两个指定的日期之间的条目。应该怎么写?本文通过几个例子,为大家梳理一下。学习时...

一文由浅入深带你完全掌握MySQL的锁机制原理与应用

本文将跟大家聊聊InnoDB的锁。本文比较长,包括一条SQL是如何加锁的,一些加锁规则、如何分析和解决死锁问题等内容,建议耐心读完,肯定对大家有帮助的。为什么需要加锁呢?...

验证Mysql中联合索引的最左匹配原则

后端面试中一定是必问mysql的,在以往的面试中好几个面试官都反馈我Mysql基础不行,今天来着重复习一下自己的弱点知识。在Mysql调优中索引优化又是非常重要的方法,不管公司的大小只要后端项目中用到...

MySQL索引解析(联合索引/最左前缀/覆盖索引/索引下推)

目录1.索引基础...

你会看 MySQL 的执行计划(EXPLAIN)吗?

SQL执行太慢怎么办?我们通常会使用EXPLAIN命令来查看SQL的执行计划,然后根据执行计划找出问题所在并进行优化。用法简介...

MySQL 从入门到精通(四)之索引结构

索引概述索引(index),是帮助MySQL高效获取数据的数据结构(有序),在数据之外,数据库系统还维护者满足特定查询算法的数据结构,这些数据结构以某种方式引用(指向)数据,这样就可以在这些数据结构...

mysql总结——面试中最常问到的知识点

mysql作为开源数据库中的榜一大哥,一直是面试官们考察的重中之重。今天,我们来总结一下mysql的知识点,供大家复习参照,看完这些知识点,再加上一些边角细节,基本上能够应付大多mysql相关面试了(...

mysql总结——面试中最常问到的知识点(2)

首先我们回顾一下上篇内容,主要复习了索引,事务,锁,以及SQL优化的工具。本篇文章接着写后面的内容。性能优化索引优化,SQL中索引的相关优化主要有以下几个方面:最好是全匹配。如果是联合索引的话,遵循最...

MySQL基础全知全解!超详细无废话!轻松上手~

本期内容提醒:全篇2300+字,篇幅较长,可搭配饭菜一同“食”用,全篇无废话(除了这句),干货满满,可收藏供后期反复观看。注:MySQL中语法不区分大小写,本篇中...

深入剖析 MySQL 中的锁机制原理_mysql 锁详解

在互联网软件开发领域,MySQL作为一款广泛应用的关系型数据库管理系统,其锁机制在保障数据一致性和实现并发控制方面扮演着举足轻重的角色。对于互联网软件开发人员而言,深入理解MySQL的锁机制原理...

Java 与 MySQL 性能优化:MySQL分区表设计与性能优化全解析

引言在数据库管理领域,随着数据量的不断增长,如何高效地管理和操作数据成为了一个关键问题。MySQL分区表作为一种有效的数据管理技术,能够将大型表划分为多个更小、更易管理的分区,从而提升数据库的性能和可...

MySQL基础篇:DQL数据查询操作_mysql 查

一、基础查询DQL基础查询语法SELECT字段列表FROM表名列表WHERE条件列表GROUPBY分组字段列表HAVING分组后条件列表ORDERBY排序字段列表LIMIT...

MySql:索引的基本使用_mysql索引的使用和原理

一、索引基础概念1.什么是索引?索引是数据库表的特殊数据结构(通常是B+树),用于...