发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

谷歌DeepMind推出WebLI-100B:千亿级数据集助力视觉语言模型升级

2025-02-14来源:ITBEAR编辑:瑞雪

近日,科技新闻界传来一项重大进展,谷歌DeepMind团队推出了一项名为WebLI-100B的数据集,这一数据集的规模达到了前所未有的千亿级别,旨在提升视觉语言模型(VLMs)在文化多样性和多语言性方面的表现。

在人工智能领域,视觉语言模型的发展依赖于大型数据集,这些数据集通常由数百万到数十亿的图像-文本对组成。这些数据集是模型学习连接图像和文本的基础,数据越多,模型在识别模式和提高准确性方面的能力就越强。然而,现有的数据集如Conceptual Captions和LAION等,尽管支持零样本分类和图像字幕生成等功能,但其增长速度已放缓,且存在样本质量低、语言偏差和多元文化代表性不足等问题。

为了克服这些限制,DeepMind的研究人员推出了WebLI-100B数据集。这一数据集包含了1000亿个图像-文本对,是之前数据集的十倍之大。WebLI-100B不仅规模庞大,更重要的是,它在文化多样性和多语言性方面取得了显著突破。通过捕获罕见的文化概念,WebLI-100B提高了模型在低资源语言和多样化表示等较少探索领域的性能。

与先前的数据集不同,WebLI-100B在构建过程中没有依赖严格的过滤策略,因为严格的过滤往往会删除重要的文化细节。相反,WebLI-100B专注于扩展数据,保留了语言和文化元素的广泛代表性,从而使其更具包容性。这一策略不仅提升了数据集的质量,还为模型提供了更丰富的训练素材。

为了分析数据缩放的影响,DeepMind的研究人员在WebLI-100B数据集的不同子集(1B、10B和100B)上进行了预训练模型的实验。实验结果表明,在完整数据集上训练的模型在文化和多语言任务中的表现优于在较小数据集上训练的模型。即使使用相同的计算资源,WebLI-100B也展现出了显著的性能提升。

研究还发现,将数据集大小从10B增加到100B对以西方为中心的基准测试的影响相对较小,但在文化多样性任务和低资源语言检索方面却带来了显著的改进。这一发现进一步证明了WebLI-100B在提升模型包容性和多语言理解能力方面的有效性。

WebLI-100B数据集的推出,标志着人工智能领域在视觉语言模型方面取得了重要进展。它不仅为模型提供了更丰富的训练数据,还通过增强文化多样性和多语言性,提高了模型的包容性和准确性。未来,随着WebLI-100B的广泛应用,我们有理由相信,视觉语言模型将在更多领域展现出更强大的能力。

同时,WebLI-100B的成功也为我们提供了宝贵的启示:在构建大型数据集时,应注重数据的多样性和包容性,避免过度依赖严格的过滤策略。只有这样,我们才能构建出更加智能、更加人性化的模型,为人类社会带来更多的福祉。

“祖冲之三号”同款芯片赋能!我国超导量子计算机“天衍-287”搭建完成并开放服务
据了解,该量子计算系统具备“量子计算优越性”能Q力,处理特定问题的速度比目前最快的超级计算机快4.5亿倍,未来将接入“天衍”量子计算云平台并首次面向全球开放应用服务,这也将是我国首个具备“量子计算优越性”的量…

2025-11-14

水库增殖放流站物联网升级:实时监测,远程管控,开启智慧渔业新模式
通过接入溶解氧传感器、水温传感器、水质监测仪、自动投料机、自动增氧机、循环水设备PLC、摄像头等多种设备,物通博联智能数采网关能够实时采集各个鱼池的水质、溶解氧、水温以及投料、增氧、循环水等设备状态,通过5…

2025-11-14

水浸传感器RS-SJ:4G蓝牙双助力,高效守护防积水安全
当检测到水浸情况时,相关信息会通过4G网络快速传输至指定的管理平台或用户终端,无需人工现场查看,让用户在第一时间知晓积水隐患,为及时采取排水、设备转移等应对措施争取时间,避免积水造成更大损失。 水浸传感器凭借…

2025-11-14

上海电信“双万兆”护航进博会:数智赋能通信保障,服务跨越语言距离
浦东机场T1电信营业厅及T2一站式服务中心电信柜台是进博会观众和外宾抵沪的“入境第一站”, 两处服务点均开设“进博专席”,为参展人员和往来旅客提供中英双语咨询、交通指引与爱心便民服务。未来,上海电信将持续夯…

2025-11-13

照片压缩至5M内超全指南!七大实用方法助你轻松搞定分享难题
具体的执行步骤是:将它们直接开启,随后去挑选照片,该应用会自动给出推荐的压缩级别,你能去预览最终结果,还能够对某些设置予以调整,比如把分辨率调低或者转换格式,借此令文件大小小于5MB,这对即时分享至社交媒体来…

2025-11-12

山海星耀攻克超低轨难题,以硬核技术逐梦空天新蓝海
天虎科技了解到,虽然当前市场上有一些针对超低轨的吸气式推进器,但从气体收集率、推进效率、测试工作环境等维度上,山海星耀的电推进器均具备一定优势。 蔡东升表示,目前该产品是商业航天公司首次实现了“高真空运行环…

2025-11-12

万卡AI集群:算力变革下数据中心建设逻辑、系统瓶颈与交付模式之变
它迫使数据中心的建设逻辑从“基建思维”转向“IT思维”;它将系统瓶颈从“算力”引向了“网络”;它也将交付模式从“工程项目”推向了“产品制造”。 当一个万卡集群被点亮时,它不再是一个被动容纳IT设备的“机房”…

2025-11-12

荣旭传媒技术破局:以专业方案化解直播痛点,成就高性价比之选
传统方案在视频、音频和网络方面存在诸多不足,而荣旭传媒通过先进的技术和专业的设备,有效解决了这些问题。传统方案的视频分辨率较低,画面不够清晰,而荣旭传媒的4K 超高清视频拍摄制作让画面质量有了质的提升;传统…

2025-11-12

Viwoods发布AiPaper Reader电纸书:6.13英寸墨水屏搭载AI阅读互动功能
IT之家 11 月 11 日消息,据科技媒体 NoteBook Check 今天报道,Viwoods 现已推出 AiPaper Reader电纸书,运行 Android 16 操作系统,机身配备专用 AI …

2025-11-12