字节跳动开源 BitSail,助力企业走好数字化“第一步”


10月26日,字节跳动宣布开源BitSail数据集成引擎。BitSail意为“数据航行”,可支持二十余种异构数据源间的数据同步,提供离线、实时、全量、增量场景下的全域数据集成解决方案,从而打通困扰企业数字化转型的“数据孤岛”,帮助企业用户更有效地发挥数据资产价值。

BitSail开源地址https://github.com/bytedance/bitsail

据悉,BitSail起源于2018年。当时字节跳动的业务场景日益复杂,数据源越来越多,数据量更是呈爆发式增长。为了支撑公司业务快速发展,字节跳动数据平台团队开始自研数据集成引擎。

新引擎最初基于Apache Flink实现,历经多年持续改进和创新,现已具备批式集成、流式集成和增量集成三类同步模式,并支持分布式水平扩展和流批一体架构,在各种数据量和各种场景下,一个框架即可解决数据集成需求。此外,BitSail采用插件式架构,支持运行时解耦,从而具备极强的灵活性,企业可以很方便地接入新的数据源。

目前,BitSail不仅服务于抖音、今日头条等字节跳动内部业务,也服务了火山引擎多家企业客户,其稳定性、数据传输质量和运维成本等方面经过“千锤百炼”,已经具备较高的产品成熟度。

数据显示,BitSail在字节跳动内部每天的任务量超过20万,传输的数据行数超过百万亿行,其中单批任务达到千亿行、单流任务达到千万QPS,支持10分钟级延迟SLA。通过在火山引擎的云原生环境和客户专有云环境等不同场景的打磨,在确保数据传输安全性的同时,BitSail的功能细节和性能得到进一步优化,可以满足企业绝大部分使用需求。

自2015年至今,字节跳动已开源了50多个项目,早期大多为工程师个人兴趣驱动。今年5月,字节跳动宣布成立开源委员会,为技术开源引入公司级的策略、规范与流程机制。BitSail项目负责人表示,做好开源的“北极星指标”是能真实落地,帮助开发者在生产环境或实际业务中创造价值。BitSail会持续夯实基础能力,并结合内外部业务实践输出更多创新的特性,帮助企业用户走好数字化“第一步”。


相關推薦

2024-10-21

近日,有消息称字节跳动发生大模型训练被实习生“投毒”事件。 据悉,该事件发生在字节跳动商业化团队,因实习生田某某对团队资源分配不满,利用HF(huggingface)的漏洞,通过共享模型注入破坏代码,导致团队模型训练成

2024-06-26

有消息称字节跳动为削减采购成本并确保高端 AI 芯片供应稳定,与美国博通(Broadcom)合作开发先进AI处理器。针对该消息,字节跳动方面对第一财经记者回应称:消息不实。 据媒体报道,字节跳动与博通合作开发的处理器为

2022-10-20

近日,CNCF 发布了最新版本的云原生全景图。字节跳动多租户网关项目 KubeZoo 被收录,在 Provisioning-Automation & Configuration 领域占有一席之地。这意味着 KubeZoo 正式成为 CNCF 认可的构建云原生最佳实践中的一环。 Landscape

2023-03-10

3月7日,由字节跳动主办,英特尔、OCP-OSF(Open System Firmware)、OSFF(Open System Firmware Foundation) 社区联合举办的“云固件交流沙龙”在北京召开。会上,字节跳动正式发布了新一代云固件 Cloud Firmware 2.0,这是首次在 X86 服务器中产品化

2024-02-23

机接口等。 对于这六大方向业内已有布局。早在2016年,字节跳动公司就成立了人工智能实验室,聚焦研究自然语言处理、机器学习、数据挖掘等方面。2023年以来,字节跳动公司加码人工智能应用研究,旗下产品不断加入AIGC(

2023-04-27

为 Primus 解决的问题。   日均作业百万核的字节跳动实践 经过字节跳动在不断实践中调整打磨的 Primus,拥有以下能力支撑业务需求: 自研训练框架:目前除了业界开源的 Tensorflow、Pytorch,为了满足用户的

2023-03-25

Katalyst 是字节跳动对多年大规模业务云原生化场景中资源管理能力的抽象和总结,我们期望通过 Katalyst 的开源直接或间接的帮助用户做好资源管理,实现降本增效。 当下互联网应用以天为单位,在线业务的资源使用情况往

2023-03-12

字节跳动开源了一款采用 Rust 开发的前端模块打包工具:Rspack(读音为/'ɑrspæk/)。 据介绍,Rspack 是一个基于 Rust 的高性能构建引擎,具备与 Webpack 生态系统的互操作性,可以被 Webpack 项目低成本集成,并提供更好的构建性

2024-07-09

两个细分领域。   现如今,企业正加速走向数字化、智能化,对数据的应用也提出了全新要求,特别是在数据实时分析、实时部署方面的诉求更加强烈,而云数据仓库为用户实现云原生、智能运维、弹性资源等业务

2024-06-25

字节跳动正在与美国芯片设计公司博通公司(Broadcom)合作开发一款先进的人工智能处理器,此举将有助于TikTok的所有者在中美关系紧张之际确保高端芯片的充足供应。 消息人士补充说,5纳米芯片是一种定制产品,被称为特

2023-02-08

源项目前 100。 国内 腾讯、华为、阿里巴巴、美团、字节跳动、百度、京东、网易、快手、圆通 等 和 国外 Google, Microsoft, Amazon, Paypal, IBM, Shopee 等数百名知名大厂员工点了 Star, 也有 腾讯、华为、字节跳动、Microsoft、Zoom、

2024-09-25

字节跳动今天在深圳举办2024火山引擎 AI 创新巡展,并发布豆包·视频生成模型以及豆包·音乐模型、豆包·同声传译模型等产品。 据悉,豆包·视频生成模型能遵从复杂 prompt,解锁时序性多拍动作指令与多个主体间的交互能力

2023-11-18

在近日举办的 Linux Plumbers Conference 上提出,字节跳动 Linux 内核工程师 Cong Wang 发表了一个“Linux Kernel Autotuning”的主题演讲,提议可以使用人工智能(AI)和机器学习(ML)来调整 Linux 内核,从而为特定工作负载带来

2024-08-28

并发表致辞。 刘烈宏指出,以数字技术为基础的产业数字化、以企业为载体的数字化成功转型,对数字经济创新发展至关重要。国家数据局大力推动企业数字化转型工作,鼓励企业加强技术创新和应用落地,构建开放、协同