# 语音转文字 **Repository Path**: dulht/speech-to-text ## Basic Information - **Project Name**: 语音转文字 - **Description**: No description available - **Primary Language**: Python - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-06-19 - **Last Updated**: 2026-07-21 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 语音转文字 Web 应用 基于 OpenAI Whisper 的语音识别 Web 服务,支持多种音频格式上传和转录。 ## 功能特性 - 🎤 支持多种音频格式:m4a, wav, mp3, flac, aac, ogg - 🔄 自动转换 m4a 格式为 wav - 🌐 支持中文和英文识别 - 📊 提供多种模型大小选择(tiny/base/small/medium/large) - 💾 实时显示转录结果 - 📥 支持下载 TXT 格式的转录结果 - 🎨 美观的 Web 界面,支持拖拽上传 ## 环境要求 - Python 3.8+ - FFmpeg(用于音频格式转换) - 至少 2GB 可用内存(取决于选择的模型大小) ## 安装步骤 ### 1. 安装 FFmpeg **Windows:** ```bash # 方法1: 使用 chocolatey choco install ffmpeg # 方法2: 手动下载安装 # 访问 https://ffmpeg.org/download.html 下载并配置环境变量 ``` **Linux:** ```bash sudo apt-get install ffmpeg ``` **macOS:** ```bash brew install ffmpeg ``` ### 2. 安装 Python 依赖 ```bash pip install -r requirements.txt ``` ### 3. 运行应用 ```bash python app.py ``` ### 4. 访问 Web 界面 在浏览器中打开:http://127.0.0.1:5000 ## 使用说明 1. **上传音频文件** - 点击"选择文件"按钮或拖拽文件到上传区域 - 支持 m4a, wav, mp3, flac, aac, ogg 格式 2. **选择参数** - **模型大小**: - Tiny: 最快,但精度较低 - Base: 推荐,速度和精度平衡 - Small/Medium/Large: 更慢但精度更高 - **语言**: 选择中文或英文 3. **开始转录** - 点击"开始转录"按钮 - 首次运行会自动下载模型(可能需要几分钟) - 等待处理完成 4. **查看和下载结果** - 转录结果会显示在页面上 - 点击"下载 TXT 文件"按钮保存结果 ## 项目结构 ``` speech-to-text/ ├── app.py # Flask 主应用 ├── speechtotxt.py # 语音转文字核心功能 ├── requirements.txt # Python 依赖 ├── templates/ │ └── index.html # Web 界面模板 ├── uploads/ # 临时上传目录(自动创建) └── results/ # 转录结果目录(自动创建) ``` ## 注意事项 1. **首次运行**: 首次使用某个模型时,会自动从网络下载,请确保网络连接正常 2. **文件大小**: 最大支持 100MB 的音频文件 3. **处理时间**: 根据模型大小和音频长度,处理时间从几秒到几分钟不等 4. **存储空间**: 不同模型占用空间不同,large 模型约需 3GB 存储空间 ## 常见问题 ### Q: 提示找不到 ffmpeg? A: 请确保已正确安装 FFmpeg 并添加到系统环境变量 PATH 中 ### Q: 模型下载失败? A: 检查网络连接,或手动下载模型文件放到缓存目录 ### Q: 转录速度慢? A: 尝试使用较小的模型(如 tiny 或 base),或使用 GPU 加速 ### Q: 识别不准确? A: 尝试使用更大的模型(如 medium 或 large),或确保音频质量良好 ## 许可证 MIT License