尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
如何用 LocalAI 的 /v1/audio/classification API 识别音频片段中的声音事件?
如何用 LocalAI 的 /v1/audio/classification API 识别音频片段中的声音事件【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI手头有一段录音想知道里面出现了哪些声音——婴儿哭声、玻璃破碎、狗叫、警报——这就是声音事件分类sound-event classification也叫 audio tagging要回答的问题我听到的是什么 LocalAI 通过/v1/audio/classification端点提供这个能力给定一段音频返回一组带分数的 AudioSet 标签。参考后端是ced.cppCED527 类 AudioSet 标签器一个作用于 log-mel 谱图的小型 ViT移植到 ggml 且与 PyTorch 完全对齐Apache-2.0 权重的 GGUF 文件可以直接从模型画廊安装。该端点按照/v1/audio/transcriptions的样式建模任何 HTTP 客户端都能调用消费端没有 Python 依赖。运行 LocalAI 并安装分类模型按本文的前提你需要已安装并可运行 LocalAI。以 Docker 为例见 快速上手docker run -p 8080:8080 --name local-ai -ti localai/localai:latest使用命令行时可以在启动时直接指定要安装的模型LocalAI 会在 API 启动前完成下载。声音分类主路径使用的模型是画廊中的ced-base-f16见 ced 模型定义后端为ced声明了sound_classification用例local-ai run ced-base-f16也可以用 CLI 单独管理模型local-ai models list # 查看画廊中的模型 local-ai models install ced-base-f16 # 安装模型关于模型变体gallery/index.yaml 中列出了同一ced后端的一系列 GGUF 权重ced-base-f16是描述中标注的推荐默认CPU 上最快、near-lossless如果在意占用空间ced-base-q8约 88 MB比 PyTorch 参考实现省约 6.5 倍内存top-5 标签一致、ced-tiny-*5.5M 参数面向 Pi 级/边缘设备、ced-mini-*9.6M 参数与ced-small-*22M 参数也是同端点可用的替代。后文示例统一使用ced-base-f16换成其它变体时只需把-F model的值换成对应名称。调用 /v1/audio/classification 端点端点为POST /v1/audio/classification Content-Type: multipart/form-data请求字段如下来自 audio-classification 文档字段类型说明file文件必填音频文件ffmpeg能接受的任意格式model字符串必填具备声音分类能力的模型名如ced-base-f16top_k整数返回的 top 标签数量0 使用后端默认值threshold浮点数丢弃低于该分数的标签发送分类请求把/path/to/clip.wav替换为你自己的音频文件路径curl http://localhost:8080/v1/audio/classification \ -H Content-Type: multipart/form-data \ -F file/path/to/clip.wav \ -F modelced-base-f16 \ -F top_k10其中top_k10是可选参数控制最多返回多少条标签threshold同理可加用于过滤低置信度标签。如何判断请求成功响应体包含两部分{ model: ced-base-f16, detections: [ {index: 23, label: Baby cry, infant cry, score: 0.87}, {index: 22, label: Crying, sobbing, score: 0.41} ] }以上为源文档给出的示例输出实际标签和分数取决于你的音频内容。判断方式与需要了解的语义detections是一个数组按分数从高到低排列每条包含indexAudioSet 标签编号、label标签文本和score分数。分数是每类的独立概率多标签、相互独立因此所有分数的和不等于 1——不要按总和接近 1来校验结果。只要拿到形如上述结构的 JSON 且detections非空说明端点、模型和音频链路都已工作detections为空或标签不符合预期时优先检查file是否为有效音频、model是否指向已安装的 ced 模型。分布式模式下的行为如果你的部署是分布式模式API 前端 独立 worker文档说明 LocalAI 会在选定的 worker 上先暂存上传的音频以及实时声音检测窗口再执行分类API 服务器与 worker 之间不需要共享临时目录。也就是说本文的 curl 示例在分布式部署下同样适用不需要额外配置共享盘。边界与下一步file字段的格式由ffmpeg决定ffmpeg不接受的格式会失败model必须是声明了声音分类能力的模型即ced后端的 ced 系列 GGUF指向普通 LLM/语音转写模型不会有分类结果本文只覆盖对已录制音频片段的分类。LocalAI 还通过 realtime websocket API 提供实时声音识别见 audio-classification 文档以及相近的 语音转写audio to text 和 说话人分离audio diarization它们解决的是说了什么和谁在说与本场景的听到什么声音事件是不同任务。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

Atmosphère libstratosphere 解析:面向 Nintendo Switch 系统模块开发的 C++ 库

Atmosphère libstratosphere 解析:面向 Nintendo Switch 系统模块开发的 C++ 库

Atmosphre libstratosphere 解析:面向 Nintendo Switch 系统模块开发的 C 库 【免费下载链接】Atmosphere Atmosphre is a work-in-progress customized firmware for the Nintendo Switch. 项目地址: https://gitcode.com/GitHub_Trending/at/Atmosphere li…

📅 2026/9/13 5:29:29
lo 库 Attempt 重试机制详解:基于 Go 1.18+ 泛型的指数级重试工具

lo 库 Attempt 重试机制详解:基于 Go 1.18+ 泛型的指数级重试工具

lo 库 Attempt 重试机制详解:基于 Go 1.18 泛型的指数级重试工具 【免费下载链接】lo 💥 A Lodash-style Go library based on Go 1.18 Generics (map, filter, contains, find...) 项目地址: https://gitcode.com/GitHub_Trending/lo/lo 本指南以…

📅 2026/9/13 5:29:29
TruffleHog 扫描 GitHub 组织速度过慢怎么解决?用 --token 提升速率限制

TruffleHog 扫描 GitHub 组织速度过慢怎么解决?用 --token 提升速率限制

TruffleHog 扫描 GitHub 组织速度过慢怎么解决?用 --token 提升速率限制 【免费下载链接】trufflehog Find, verify, and analyze leaked credentials 项目地址: https://gitcode.com/GitHub_Trending/tr/trufflehog 用 TruffleHog 的 github 子命令扫描整个…

📅 2026/9/13 5:29:29
MORE NEWS

更多资讯

📰

汉诺塔第m步求解:递归分治思想与C++实现

1. 题目理解与整体思路拆解1.1 汉诺塔基础回顾汉诺塔问题对我来说算是老朋友了,每次刷OJ碰到它都有种“去年今日此门中”的感觉。这道东华OJ-基础题-128,题面很直接:给你一个经典的汉诺塔游戏,三根柱子,n个盘子&#x…

📰

非标自动化设计中的多轴建模与iRobotCAM应用

1. 非标自动化设计中的多轴建模挑战在工业自动化领域,非标设备的设计与实现一直是工程师们面临的核心难题。与标准化生产线不同,非标自动化项目往往需要根据特定产品、特定工艺进行定制化开发,这就对设计工具提出了更高要求。传统CAD软件虽然…

📰

基恩士CV-X400接入PROFIBUS DP:GSD文件安装与I/O映射实战指南

简介:基恩士CV-X400系列GSD文件包面向视觉系统集成工程师、自动化设备调试人员及PLC/上位机开发者,是评估相机与控制系统兼容性的关键配置数据。压缩包共2个文件,以GSDML(XML)描述文件为核心,另附BMP格式的…

📰

京东销量预测源码拆解:特征工程与RNN/GBDT融合实践

简介:一套基于深度学习的京东商品销量预测设计源码,面向电商数据挖掘与深度学习开发者,提供从数据清洗、特征工程到RNN建模、评估与提交结果的全流程实现。资源共51个文件,压缩包约6.96MB,包含10个Python源码文件、10个…

📰

Wagtail 文档模块(wagtail.documents)实战指南:模型、上传、存储与安全防护

Wagtail 文档模块(wagtail.documents)实战指南:模型、上传、存储与安全防护 【免费下载链接】wagtail A Django content management system focused on flexibility and user experience 项目地址: https://gitcode.com/GitHub_Trending/wa…

📰

本科生降低AI生成内容检测率的8款工具与技巧

1. 项目概述:本科生如何有效降低AI生成内容检测率作为一名经历过论文查重和AI检测双重考验的高校导师,我发现越来越多本科生在学术写作中面临AI生成内容识别的新挑战。不同于传统的查重系统,Turnitin、万方等平台新增的AI检测功能能识别出GPT…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬