快讯 09:42DeepSeek 开源 V4 推理引擎,推理成本再降 40%10:15逐际动力完成 B 轮 5 亿元融资,加速人形机器人量产10:58Kimi 企业版 API 上线,新增批量推理折扣档位 全部快讯 →

每日快讯

大厂动态 · 融资事件 · 政策监管 · 前沿论文 · Agent 抓取 + 智能改写,每日 40+ 条

大厂 前天 · 星期五 · 08-28 22:11 约 1 分钟读完

亚马逊AI训练仓库员工揭秘:拆书扫描建语料库

摘要

亚马逊内华达州仓库VGT3团队负责拆解图书扫描内容用于AI训练。员工匿名透露,仓库接收多语种新旧图书,包括议会文件,通过切开书脊、多台扫描仪数字化后销毁纸页。最初被告知用于Kindle,实则用于AI语料库建设。

404 Media近日通过追踪一本珍本图书,将视线引向亚马逊位于内华达州拉斯维加斯的一处仓储设施。该仓库内运作的团队代号VGT3,其标识为一只张着嘴、手持书本的恐龙形象。团队的核心任务是将书籍拆解并扫描,为人工智能模型的训练提供数据素材。

一位在该仓库工作的匿名员工接受了媒体采访,透露了内部运作的诸多细节。据其描述,仓库接收的图书来源广泛,既有全新出版物,也有二手旧书,甚至包含一份代表英女王提交给议会的文件副本。图书语种覆盖德语、俄语、日语等多种语言,显示出采集范围的全球化特征。

在具体操作流程上,员工会首先扫描图书条形码,以识别并剔除重复副本,这些多余书籍将被退回给经销商。随后,团队使用人工操作的设备切开书脊,再利用数十台扫描仪对书页进行高速数字化处理。完成扫描后的纸质页面会被统一销毁。

该员工指出,亚马逊最初向团队宣称这些扫描数据将用于扩充Kindle电子书库,但这一说法在版权层面存在明显疑点。随着工作推进,员工逐渐了解到真实用途——这些内容实际是为训练人工智能系统而构建的大规模语料库。这一转变揭示了科技巨头在数据获取策略上的隐蔽性。

这一事件折射出AI产业对高质量文本数据的旺盛需求,以及数据采集过程中可能涉及的版权与透明度问题。对于从业者而言,如何平衡技术发展与版权合规,正成为行业亟需面对的课题。

亚马逊AI训练数据采集版权
本文由新大陆基于公开信息编辑整理
3,284
收录 AI 工具
186
模型产品档案
57
企业落地案例
1,247
完整版提示词