AIGCPanel v2.5.0 接入云端双引擎,数字人与直播音色分库各管各的
AIGCPanel v2.5.0 接入火山引擎豆包语音与阿里云百炼DashScope,无显卡也能完成高质量语音合成;数字人音色与直播音色分库管理,直播控制台新增模型控制与实时日志,并修复多项异常与界面问题。
发布时间:2026/09/29 03:05|分类:人工智能
AIGCPanel v2.5.0 把云端语音能力接进桌面应用。在 AI 模型页“其他模型”入口填入火山引擎豆包语音或阿里云百炼DashScope的 API Key,云端语音模型即可上线,无本地显卡也能完成高质量语音合成。保存前会先合成“你好,这是一段语音试听。”验证接口可用。底层由语音 provider 注册表维护:豆包语音走 X-Api-Key 鉴权,返回多段 JSON 拼接单向流,按分片解析合并;阿里云走 DashScope 的 qwen-tts,返回音频链接或 base64 数据。新增厂商只需写一个 provider 文件。
声音被收拢为成体系管理:数字人侧“语音音色”和直播侧“直播音色”分表存储、互不干扰;声音克隆需重新录制或上传参考音频并配文字。底层 VoiceService 工厂配合 SoundVoice 与 LiveVoice 两个存储标识,每条音色记录类型、模型标识、参数和参考音频路径,试听与直播实时合成走同一条 synthesize() 调用链。直播换音色无需改动直播服务,客户端只暴露带 Voice: 前缀的 provider 名,旧配置自动回退。
直播控制台新增“模型控制”区域,可启动、停止直播模型并查看运行状态与实时日志;未导入模型时主动提示跳转。界面细节优化:弹窗自动撑高防止溢出,导航选中改用品牌蓝浅色底块,禁用按钮样式更清晰;并修复异常退出误判成功、英文界面显示中文错误、新版 Windows 上 wmic 报错等问题。
老功能方面,v2.0.0 可视化工作流支持拖拽节点串联大模型、脚本、工具箱并断点续跑;v2.2.0 增加文生图、图生视频;v2.3.0 开放 API 服务与接口;v2.4.0 上线绿幕视频替换背景和歌曲翻唱。此次 v2.5.0 将云端语音与音色管理收进统一体系。