亚马逊AI训练仓库员工揭秘:拆书扫描建语料库
摘要
亚马逊内华达州仓库VGT3团队负责拆解图书扫描内容用于AI训练。员工匿名透露,仓库接收多语种新旧图书,包括议会文件,通过切开书脊、多台扫描仪数字化后销毁纸页。最初被告知用于Kindle,实则用于AI语料库建设。
404 Media近日通过追踪一本珍本图书,将视线引向亚马逊位于内华达州拉斯维加斯的一处仓储设施。该仓库内运作的团队代号VGT3,其标识为一只张着嘴、手持书本的恐龙形象。团队的核心任务是将书籍拆解并扫描,为人工智能模型的训练提供数据素材。
一位在该仓库工作的匿名员工接受了媒体采访,透露了内部运作的诸多细节。据其描述,仓库接收的图书来源广泛,既有全新出版物,也有二手旧书,甚至包含一份代表英女王提交给议会的文件副本。图书语种覆盖德语、俄语、日语等多种语言,显示出采集范围的全球化特征。
在具体操作流程上,员工会首先扫描图书条形码,以识别并剔除重复副本,这些多余书籍将被退回给经销商。随后,团队使用人工操作的设备切开书脊,再利用数十台扫描仪对书页进行高速数字化处理。完成扫描后的纸质页面会被统一销毁。
该员工指出,亚马逊最初向团队宣称这些扫描数据将用于扩充Kindle电子书库,但这一说法在版权层面存在明显疑点。随着工作推进,员工逐渐了解到真实用途——这些内容实际是为训练人工智能系统而构建的大规模语料库。这一转变揭示了科技巨头在数据获取策略上的隐蔽性。
这一事件折射出AI产业对高质量文本数据的旺盛需求,以及数据采集过程中可能涉及的版权与透明度问题。对于从业者而言,如何平衡技术发展与版权合规,正成为行业亟需面对的课题。
本文由新大陆基于公开信息编辑整理
信息来源:Solidot Solidot原文 ↗