这是给谁的
任何有录音又不想逐字敲出来的人。一场必须变成会议记录的四小时会议。一篇要放到堂区网站上的讲道。需要准确引用的采访。学生们想搜索而不是重看一遍的课程。
怎么运作
- 1
你上传文件。常见格式都行——wav、mp3、m4a、ogg——视频也可以,声音我们自己提取。
- 2
我们先找出哪里有讲话,告诉你那是多少分钟、要花多少钱。进队列之前你就知道价格。
- 3
它在没有任何直播房间需要显卡时运行,这样录音永远不会耽误别人的活动。
- 4
做完我们会发邮件通知你,结果在你的账户里等着。
你得到什么
- 完整文本,用当时讲的语言。
- SRT 和 VTT 字幕,带各自的时间码。
- 原始的发言段落,JSON 格式,含起止时间,方便喂给别的工具。
- 只有讲话:沉默、掌声和空白既不在里面,也不计费。
- 你上传的文件在任务完成的那一刻就被删除。
- 结果在账户里保留七天。
边界在哪里: 每段录音最长 60 分钟、200 MB,同时三个任务。一段录音大约需要它自身长度的十分之一——机器空闲时,一小时音频大概等六分钟。
问题
- 准确度能到什么程度?
- 这几乎完全取决于录音。安静房间里的领夹麦克风几乎能完美转写;有回声的大厅里放在桌上的手机会丢词,而这一点事后任何引擎都修不好。
- 会加标点吗?
- 会——句号、逗号和大写。它是写来给人读的,不是一堵小写字母的墙。
- 可以发视频吗?
- 可以。mp4、mov、mkv、avi 和 webm。我们提取其中的音频并处理它;视频不会被保存。
- 我的录音会被用来训练什么吗?
- 不会。任务结束时它就被删除,除了留在你账户里的转写之外什么都不剩。
- 如果音频里不止一种语言呢?
- 引擎会检测正在讲的是什么。如果人们中途换语言,请告诉我们:这种情况值得先拿你自己的音频试一次再依赖它。