这是给谁的
任何有录音又不想逐字敲出来的人。一场必须变成会议记录的市政会议。一篇要放到堂区网站上的讲道。需要准确引用的采访。学生们想搜索而不是重看一遍的课程。
怎么运作
- 1
你上传文件。常见格式都行——wav、mp3、m4a、ogg——视频也可以,声音我们自己提取。
- 2
我们先找出哪里有讲话,告诉你那是多少分钟、要花多少钱。进队列之前你就知道价格。
- 3
它在没有任何直播房间需要显卡时运行,这样录音永远不会耽误别人的活动。
- 4
做完我们会发邮件通知你,结果在你的账户里等着。
你得到什么
- 完整文本,用当时讲的语言。
- SRT 和 VTT 字幕,带各自的时间码。
- 原始的发言段落,JSON 格式,含起止时间,方便喂给别的工具。
- 只有讲话:沉默、掌声和空白既不在里面,也不计费。
- 你上传的文件在任务完成的那一刻就被删除。
- 结果在账户里保留十五天。
边界在哪里: 每段录音最长 音频 4 小时、视频 1 小时、800 MB,同时三个任务。更长的会议分成几段上传。一段录音大约需要它自身长度的十分之一——机器空闲时,一小时音频大概等六分钟。
问题
- 准确度能到什么程度?
- 这几乎完全取决于录音。安静房间里的领夹麦克风几乎能完美转写;有回声的大厅里放在桌上的手机会丢词,而这一点事后任何引擎都修不好。
- 会加标点吗?
- 会——句号、逗号和大写。它是写来给人读的,不是一堵小写字母的墙。
- 可以发视频吗?
- 可以。mp4、mov、mkv、avi 和 webm。我们提取其中的音频并处理它;视频不会被保存。
- 我的录音会被用来训练什么吗?
- 不会。任务结束时它就被删除,除了留在你账户里的转写之外什么都不剩。
- 如果音频里不止一种语言呢?
- 引擎会检测正在讲的是什么。如果人们中途换语言,请告诉我们:这种情况值得先拿你自己的音频试一次再依赖它。
对一个文件还能做的事
同一个文件、同一个引擎、同一个积分钱包。几乎没人只需要其中一项:转写完一场会议,最后总会想知道是谁在说。
只有你们那里才用的词
一个机构自己的名字——人名、街名、编号、职务——正是通用模型从没听过的东西,也正是它出错的地方:它会换成一个听起来差不多的普通词。写一次,就不再出错。 写在任务里,对那段录音生效。
- 这是一份清单,不是训练:写下来,从第一句话就生效。
- 它什么都不收集。不收你的音频,不收你的文本,一秒都不收。
- 而且是包含在内的。不是额外的套餐,也不是账单上的一行。