海螺AI:读一段话就能克隆你的音色,还能实时语音通话
一个把"声音"做成主业的 AI 平台:读一段话就能克隆你的音色,还能用文字捏出全新的嗓音,顺便把实时语音通话也做了。
先说一件容易让人绕晕的事。今天打开海螺AI 的首页,最显眼的位置写着"海螺视频",页面里铺的是视频生成和玩法精选;而语音那一块,入口已经统一收在 MiniMax 的语音站里,导航栏上排着音色库、语音合成、音乐创作、音色设计、声音克隆、人声提取。也就是说,它早就不只是当初那个对话助手了——现在它更像 MiniMax(上海稀宇科技)旗下一个多模态工具合集,视频、图像、语音、音乐各占一块,语音是其中做得最厚的那一层。
这篇就只聊语音这一层。原因很简单:视频和图片这块大家多少都摸过,而语音那套东西——尤其是声音克隆和实时通话——很多人还不知道已经能做到什么程度了。
朗读一段文字,出来的就是你的音色
声音克隆的流程比想象中短。进到"声音克隆"页,页面顶部一句话讲完了全部:"朗读一段文字,即可克隆你的专属声音"。下面是场景选择,随机、有声读物、影视配音、Vlog 独白、教育培训、电台播客、智能客服,挑一个你顺口的念;旁边是试听文本,用中文普通话读,界面右下角会实时数字符。
要准备的素材量也不夸张:录一段或传一段10 秒到 5 分钟的音频就够,单个文件不超过 50MB。官方还留了两个提相似度的小开关——可选"口音优化",也可以从音频样本里去掉背景噪音,对录音环境一般的人挺友好。

有一点得提前说清楚,免得白折腾:声音克隆是会员功能。免费用户能把克隆效果试听出来,但要保存下来真正使用,得先订阅会员。页面按钮旁边那行小字写得很直白——"免费用户仅可预览音色"。不过试听这件事本身有独立额度:官方说明里写着,每位用户每天有 5 次音色预览音频的免费试听机会,而且这个次数是"声音克隆"和"音色设计"两个页面共用的,在哪边试听都会扣掉一次。用完再想试,就按规则消耗声贝。
会员这边给的空间比较宽裕:订阅后可以解锁多达 100 个语音克隆槽位,音频生成时长上限也拉到长达 20 小时。做有声书或者系列内容的人,这个量级基本不用天天删旧的腾位置。
文字转语音:一个标签就能改语气
如果说声音克隆解决的是"像不像你",那文字转语音解决的是"听起来对不对味"。当前这一版默认挂的是 speech-2.8-hd 模型,输入框左下角给了一排可以直接敲进去的标记:情绪、<#> 停顿、() 语气词。它的玩法是把这些标签直接写进正文里,比如在一句话前标上情绪、想问号处插一个停顿,生成出来的音频就会带着这些起伏。
右侧是调音台,语速、声调、音量三个滑杆,加上音色效果调节,换一个音色再调一遍,很容易找到你要的那个感觉。音色库里的选项也够挑:新闻女声、沉稳高管这类职场向的,也有睡前低语、恐怖故事、哥布林的交易、科幻风格这类内容和娱乐向的,标签上直接标了语种和适用场景。

长文本是它的一个强项。单次输入的字数上限,HD 模式是 5,000 字符,Turbo 模式 10,000 字符;如果还不够,打开长文模式,单次合成最长支持到 20 万字符——整本小说、整份课件丢进去都属于它的正常使用范围,不用自己切段拼接。代价是等待时间,好在界面右下角会实时估算声贝消耗,心里有数。
不想克隆?那就用文字捏一个新音色
音色设计是另一条路,也是我更喜欢的一个功能。它不需要你提供任何音频素材,全靠一段文字描述——页面上的示例写得很具体:"讲述悬疑故事的播客页,声音低沉富有磁性,语速时快时慢,营造紧张神秘的氛围"。说白了,你把想要的声音特征写成一句话,它给你造一个出来。
懒得想措辞也可以直接点预设:年迈智者、激情解说、悬疑故事家、摇篮曲女声、严厉女教师,几个方向覆盖了讲故事、解说、哄睡这些典型场景。试听文本可以自己写,也可以让页面自动生成——它默认就在"这个音色由 MiniMax 最新的音色设计模型生成"这句话上。

前面提过的那个额度在这里同样生效:每日 5 次免费试听,和声音克隆页面共用。页面右下角还会显示"剩余音色槽位",克隆和设计出来的音色都占位——所以订阅之后那 100 个槽位是这两件事一起分的,心里得有个账。
人声提取与音乐:顺手但不好替代的两件小事
语音工具台里还塞了两个日常会用到的东西。一个是人声提取,把音频或视频里的环境噪音、背景声压下去,把原始人声提干净再增强,录播客、做翻唱或者处理采访录音都用得上,界面上的限制写的是文件不超过 500MB、时长不超过 300 秒。另一个是音乐创作,当前是 MiniMax Music 3.0,风格上分了电子、R&B、流行、爵士、乡村、蓝调几档,定位是给短视频和演示配一段不撞车的背景音乐。

另外它是有实时语音通话的,界面上能看到语音打断、开场白这些设置项,以及"请在系统设置中打开麦克风权限""正在连接中"这类状态提示。聊到一半直接出声打断,不用等它说完——这类细节决定了它能不能真的当"对话"用,而不只是"念稿"。
关键信息速查
项目 | 情况 |
|---|---|
开发方 | MiniMax(上海稀宇科技) |
支持平台 | 网页端、iOS、Android |
网页端主站构建号 | 0.1.794(2026 年 9 月抓取) |
语音工具台构建号 | 0.1.19(独立构建,与主站分开发版) |
iOS 端版本 | 4.19.1(2026-09-08) |
语音合成模型 | speech-2.8-hd |
声音克隆素材 | 10 秒 – 5 分钟,单文件 ≤ 50MB |
免费试听额度 | 每日 5 次音色预览(克隆/设计页面共用) |
版本这块多说一句:海螺AI 的网页主站和语音工具台是分开构建、分开发版的,所以你会看到两个不一样的构建号,这不是版本混乱,是两个应用。手机端则走 iOS 和 Android 各自的版本线。截至 2026 年 9 月,官方提供的是网页端和手机端,想在电脑上用直接开浏览器就行。
免费能用到什么程度
它的计费单位叫"声贝"。新用户登录进去直接送 10000 积分,官方给的说法是相当于超过 12 分钟的音频生成时间——拿来把每个功能都点一遍、试几段短文本,是够的。之后可以按需买声贝包,不用非得在几个会员档位之间纠结;也可以直接订阅会员,把克隆槽位和生成时长上限一起拉开。
授权规则值得单独看一眼。个人用途——发社交媒体、非营利的会议这类——生成的音频可以免费使用,前提是加上官方标识或标注音频来源。要往商业用途走,比如做创收内容或商业项目,就得订阅标准版会员及以上。这条线划得挺清楚,做商业内容之前最好先确认自己落在哪一档。
最后提个醒:网上流传的一些"海螺AI 电脑版安装包"并不是官方出的,官方客户端目前只有手机端,电脑上直接开网页更省事。遇到来路不明的 exe 建议别碰。
一句话收尾:它把语音这件事拆成了"克隆自己的"和"造一个想要的"两条路,前者读一段话就够,后者写一句话就够——真正值得留意的不是效果有多真,而是这两种方式已经把门槛降到了不需要任何音频处理经验。