
问:2025年,在全球AI平台HuggingFace发布的TTS Arena榜单上,烁谷科技自研的 Vocu V3 语音合成模型登顶世界第一。这一创新的起点是什么?
答:我在巴黎大学求学期间,做过一个叫“木几萌”的AI虚拟主播项目,当时在B站收获了很高的关注度。
这个虚拟主播在说话内容、行为、思维逻辑等方面都比较“像人”,但唯独声音还是非常僵硬,很有机械感。我们找遍了市面上所有的技术方案,都没有找到能匹配预期的效果。我们想,干脆就自己来,用生成式大模型的思路来做声音合成,最后发现效果非常好,这才一步步延伸出完整的产品路径。
问:后面你从巴黎大学休学回国创业,为什么如此坚决?
答:核心原因是AI行业的机会窗口不等人,这是全球都在抢的风口。全球的语音市场已经到了千亿美元以上的量级,行业的终极目标是打破人机交互的“恐怖谷”,让AI能够真的像人一样说话。
杠杆股票配资这一轮AI技术迭代的速度太快了,如果按部就班,时机就错过了。当时,我们的产品已经展现出明显技术优势,也有风险投资愿意支持,所以我很快就决定回国创业。
元股证券:ygzq.hk成果也比较显著。我们打造了名叫“悟声”的语音大模型,仅需3秒的样本就能瞬时克隆音色,相似度在99.5%以上,一下就击中了市场痛点,上线仅3个月用户量就突破百万。
问:AI产业竞争激烈,市场上大厂云集,你的底气从何而来?
答:AI这个行当,规模大不是核心优势,速度快才是。用生成式AI做音频合成,我们抢跑在很多大厂前面将近一年。另外,我们团队在音频领域有独到的认知和审美,技术先发和领域深耕的叠加效应,让我们能打造出真正有竞争力的产品。
面对越来越白热化的竞争,保持领先的关键是敢于更大胆地设想创意炸板原因,同时又以极高效的方式落地实施。现在AI行业很多人热衷于堆参数、拼规模,但音频领域真正重要的是对新想法、新技术的快速迭代和探索能力。
配资管理监察网提示:本文来自互联网,不代表本网站观点。