您的位置:首页 > 手游攻略 > OpenAI Whisper API:快速音频转文本 - Openclaw Skills

OpenAI Whisper API:快速音频转文本 - Openclaw Skills

作者:互联网  时间: 2026-07-30 17:20:01  

什么是 OpenAI Whisper API 转录?

此技能提供了一个简化的界面,用于与 OpenAI 音频转录 API 进行交互。它允许开发者使用 whisper-1 模型将各种音频格式转换为文本或 JSON。通过利用 Openclaw Skills,用户可以直接从终端或 AI 代理环境自动化转录工作流程,在保持对模型参数和输出目标控制的同时,确保快速准确的语音转文本转换。

下载入口:https://github.com/openclaw/skills/tree/main/skills/steipete/openai-whisper-api

安装与下载

1. ClawHub CLI

从源直接安装技能的最快方式。

npx clawhub@latest install openai-whisper-api

2. 手动安装

将技能文件夹复制到以下位置之一

全局模式 ~/.openclaw/skills/ 工作区 <project>/skills/

优先级:工作区 > 本地 > 内置

3. 提示词安装

将此提示词复制到 OpenClaw 即可自动安装。

请帮我使用 Clawhub 安装 openai-whisper-api。如果尚未安装 Clawhub,请先安装(npm i -g clawhub)。

OpenAI Whisper API 转录 应用场景

  • 将会议录音或语音备忘录转换为可搜索的文本文件。
  • 为播客或视频内容生成转录文本,以提高可访问性和 SEO。
  • 使用 Openclaw Skills 将自动化转录集成到数据处理流水线中。
  • 使用自定义提示参数提高特定技术术语或名称的转录准确性。
OpenAI Whisper API 转录 工作原理
  1. 用户在 Openclaw Skills 目录中向转录脚本提供音频文件路径。
  2. 脚本对所需的 OpenAI API 密钥和 curl 二进制文件的存在进行预检。
  3. 向 OpenAI /v1/audio/transcriptions 端点发送包含音频文件和用户指定标志的 POST 请求。
  4. OpenAI API 使用 Whisper 模型处理音频并返回转录文本或结构化数据。
  5. 该技能捕获响应并将输出保存到用户配置定义的文本或 JSON 文件中。

OpenAI Whisper API 转录 配置指南

首先,确保您拥有有效的 OpenAI API 密钥。您可以将其设置为环境变量或将其添加到全局配置文件中,以便与 Openclaw Skills 一起使用。

export OPENAI_API_KEY='your_api_key_here'

或者,在您的配置文件中进行配置:

{
  "skills": {
    "openai-whisper-api": {
      "apiKey": "OPENAI_KEY_HERE"
    }
  }
}

确保您的系统上安装了 curl,因为它是用于 API 通信的主要二进制文件。

OpenAI Whisper API 转录 数据架构与分类体系

该技能使用以下结构处理输入和输出数据:

组件 描述
输入文件 支持常见的音频格式,如 m4a, mp3, ogg, wav, 和 webm。
默认输出 在同一目录中使用输入文件名生成 .txt 文件。
JSON 输出 启用 --json 标志时提供详细的转录元数据。
元数据 Openclaw Skills 注册表跟踪 curl 等依赖项和所需的环境变量。
name: openai-whisper-api
description: Transcribe audio via OpenAI Audio Transcriptions API (Whisper).
homepage: https://platform.openai.com/docs/guides/speech-to-text
metadata: {"clawdbot":{"emoji":"??","requires":{"bins":["curl"],"env":["OPENAI_API_KEY"]},"primaryEnv":"OPENAI_API_KEY"}}

OpenAI Whisper API (curl)

Transcribe an audio file via OpenAI’s /v1/audio/transcriptions endpoint.

Quick start

{baseDir}/scripts/transcribe.sh /path/to/audio.m4a

Defaults:

  • Model: whisper-1
  • Output: <input>.txt

Useful flags

{baseDir}/scripts/transcribe.sh /path/to/audio.ogg --model whisper-1 --out /tmp/transcript.txt
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --language en
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --prompt "Speaker names: Peter, Daniel"
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --json --out /tmp/transcript.json

API key

Set OPENAI_API_KEY, or configure it in ~/.clawdbot/clawdbot.json:

{
  skills: {
    "openai-whisper-api": {
      apiKey: "OPENAI_KEY_HERE"
    }
  }
}

最新游戏

更多

Copyright©2010-2019. All rights reserved | 波波三国游戏官网|[email protected]

备案编号:湘ICP备2022015115号-4