跳至主要内容
Google Cloud Documentation
文档
  • 开始使用
  • Google Cloud 使用入门
  • 商品列表
  • Cloud Customer Care
  • 精选产品
  • Agent Platform
  • Apigee API Management
  • BigQuery
  • Compute Engine
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL
  • Gemini Enterprise
  • 交互的能力
  • Looker
  • 跨产品工具
  • 访问权限和资源管理
  • 费用和用量管理
  • 基础设施即代码
  • SDK、语言、框架和工具
  • 技术领域
  • AI 和机器学习
  • 应用开发
  • 应用托管
  • 计算
  • 数据分析和流水线
  • 数据库
  • 分布式云、混合云和多云
  • 行业解决方案
  • 迁移
  • 网络
  • 可观测性和监控
  • 安全
  • Storage
/
控制台
  • English
  • Deutsch
  • Español – América Latina
  • Français
  • Indonesia
  • Italiano
  • Português – Brasil
  • עברית
  • 中文 – 简体
  • 中文 – 繁體
  • 日本語
  • 한국어
  • Managed Service for Apache Spark
免费开始使用吧
概览 指南 参考文档 示例 资源
Google Cloud Documentation
  • 文档
    • 更多
    • 概览
    • 指南
    • 参考文档
    • 示例
    • 资源
  • 控制台
  • 概览
  • 主要概念
  • Managed Service for Apache Spark 无服务器
    • 概览
    • Managed Service for Apache Spark 无服务器层级
  • 集群上的 Managed Service for Apache Spark
  • 比较无服务器部署和集群部署
  • GKE 上的 Managed Service for Apache Spark
  • 开始使用
  • 无服务器
    • 创建无服务器 Spark 批量工作负载
  • 集群
    • 创建集群
    • 将 Spark 作业提交到集群
    • Spark 教程
      • 使用 Gemini 开发 Spark 应用
      • 使用 Spark 分析公开数据集
      • 使用 Spark MLlib 进行情感分析
  • GKE
    • 在 Kubernetes 上运行 Spark 作业
  • 开发
  • 无服务器
    • 配置无服务器
      • 使用自定义容器
      • 使用 GPU
      • 使用动态工作负载调度器
      • 网络配置
      • Spark 运行时版本
        • 概览
        • Spark 运行时版本 3.0
        • Spark 运行时版本 2.3
        • Spark 运行时版本 2.2
        • Spark 运行时版本 1.2
      • 服务账号
      • Spark 属性
      • 暂存存储桶
    • 创建批处理工作负载和会话
      • 创建无服务器 Spark 批量工作负载
      • 创建无服务器交互式会话和会话模板
      • 使用无服务器 Spark Connect 客户端
      • 使用 JupyterLab 进行无服务器批处理会话和笔记本会话
      • 使用无服务器模板
        • 概览
        • Cloud Spanner 到 Cloud Storage
        • Cloud Storage 到 BigQuery
        • Cloud Storage 到 Cloud Spanner
        • Cloud Storage 到 Cloud Storage
        • Cloud Storage 到 JDBC
        • Hive to BigQuery
        • 从 Hive 迁移到 Cloud Storage
        • JDBC to BigQuery
        • JDBC 到 Cloud Spanner
        • JDBC 到 Cloud Storage
        • JDBC 到 JDBC
        • Pub/Sub 到 Cloud Storage
    • 在 Lakehouse 运行时目录中创建包含元数据的 Apache Iceberg 表
    • 转换数据并写入 Apache Iceberg
    • 将 BigQuery 连接器与 Spark 搭配使用
      • 概览
      • 查询 BigQuery 表
    • 在 BigQuery Studio 笔记本中运行 PySpark 代码
    • 优化
      • 自动扩缩工作负载资源
      • 自动微调 Spark 工作负载
      • 使用 Lightning Engine
        • 使用 Lightning Engine 加速批处理工作负载和会话
        • 运行原生查询执行资格认证工具
      • 无服务器 Spark 解决方案加速器
  • 集群
    • 数据处理
      • 配置 Spark
        • 管理 Spark 依赖项
        • 自定义 Spark 环境
        • 启用并发写入
        • 提升 Spark 性能
        • Tune Spark
        • 使用 Lightning Engine
      • 运行 Spark 作业
        • 使用控制台
        • 使用命令行
        • 使用 REST APIs Explorer
          • 创建集群
          • 运行 Spark 作业
          • 更新集群
          • 删除集群
        • 使用客户端库
      • 运行 Hadoop 作业
      • 编写及运行 Spark Scala 作业
      • 运行 Trino
      • 运行 Flink
      • 运行 Hive
      • Run Pig
      • 运行 HBase
      • 运行 Python
        • 配置 Python 环境
        • 使用 Python 版 Cloud 客户端库
      • 使用数据连接器
        • 使用 Spark BigQuery 连接器
          • 概览
          • BigQuery 连接器代码示例
        • 使用 Cloud Storage 连接器
        • 使用 Spark Spanner 连接器
    • 数据湖和湖仓
      • 探索和提取数据
      • 转换数据
      • 将数据加载到 BigQuery 中
      • 使用 Spark 创建湖仓一体
      • 配置 metastore
      • 在 BigLake metastore 中创建包含元数据的 Apache Iceberg 表
      • 使用 Iceberg
      • 使用 Delta
      • 使用 Hudi
    • 数据科学笔记本和界面
      • 使用笔记本
        • 概览
        • 在集群上运行 Jupyter 笔记本
        • 在笔记本上运行基因组分析
        • 使用 JupyterLab 扩展程序开发无服务器 Spark 工作负载
      • 使用组件网关
    • 数据源和存储
      • 连接到数据源
      • 连接到 Cloud Storage
      • 连接到 BigQuery
      • 将 Hive 连接到 BigQuery
      • 连接到 Bigtable
      • 连接到 Pub/Sub Lite
    • 管理和数据治理
      • 舰队管理
      • 沿袭
        • 启用 Spark 数据沿袭
        • 启用 Hive 数据沿袭
    • 配置集群
      • 组件
        • 概览
        • Delta Lake
        • Docker
        • Flink
        • HBase
        • Hive WebHCat
        • Hudi
        • Iceberg
        • Jupyter
        • 猪
        • Presto
        • Ranger
          • 安装 Ranger
          • 使用 Ranger
            • 将 Ranger 与 Kerberos 搭配使用
            • 将 Ranger 与缓存和缩小范围搭配使用
            • 备份和恢复 Ranger 架构
        • Solr
        • Trino
        • Zeppelin
        • ZooKeeper
      • 聚类图片
        • 概览
        • 服务
        • 集群映像版本
          • 概览
          • 3.0.x 发布版映像版本
          • 2.3.x 发布版本映像
          • 2.2.x 发布版映像版本
          • 2.1.x 发布版本映像
      • 计算选项
        • 机器类型
        • GPU
        • 满足最低 CPU 要求的平台
        • 灵活的虚拟机
        • 辅助工作器
        • 本地固态硬盘
        • 启动磁盘
        • 已挂接的 Hyperdisk
    • 创建集群
      • 概览
      • 配置网络
        • 概览
        • 使用安全标记
        • 配置 Private Service Connect
      • 选择集群区域
      • 启用自动选择地区功能
      • 安排集群删除
      • 使用初始化操作
      • 设置集群元数据
      • 设置集群属性
      • 启用集群网页界面
      • 创建高可用性集群
      • 创建节点组集群
      • 创建部分集群
      • 创建零规模集群
      • 创建单节点集群
      • 创建单租户集群
      • 创建自定义映像
    • 管理集群
      • 设置过滤标签
      • 扩缩集群
      • 启动和停止集群
      • 自动扩缩集群
        • 概览
        • 启动和停止集群
        • 安排集群停止
      • 重新创建集群
      • 轮替集群
      • 更新和删除集群
      • 使用 SSH 连接到集群
      • 遵循最佳做法
        • 概览
        • 最大限度地提高集群和作业的灵活性和效率
      • 管理集群数据
        • Hadoop 数据存储
        • 选择存储空间类型
        • 缓存集群数据
        • 分流 shuffle 数据
        • 查看集群日志
    • 管理和编排作业
      • 作业生命周期
      • 重启作业
      • 使用工作流模板
        • 概览
        • 参数化
        • 使用 YAML 文件
        • 使用集群选择器
        • 使用内嵌工作流
      • 编排工作流
        • GitHub 模板
        • 工作流安排解决方案
        • 使用工作流模板
        • 使用 Cloud Composer
        • 使用 Cloud Functions
        • 使用 Cloud Scheduler
  • GKE
    • 创建节点池
    • 重新创建 GKE 虚拟集群
    • 创建 GKE 自定义容器映像
    • 扩缩 GKE 集群
    • 删除 GKE 虚拟集群
    • 发布版本
  • 管理和治理
  • 无服务器
    • 权限和角色
    • 角色和无服务器 IAM 角色
    • 将 CMEK 与 Serverless for Apache Spark 搭配使用
    • 默认安全措施
    • 使用 Secret Manager
    • 创建自定义限制条件
  • 集群
    • 安全性方面的最佳做法
    • 对用户进行身份验证
      • 对 Managed Service for Apache Spark 进行身份验证
      • 对个人集群进行身份验证
      • 员工身份联合
    • 分配角色
      • 权限和角色
      • Managed Service for Apache Spark 主账号
      • Granular IAM
      • 为 Kubernetes 分配角色
    • 服务账号
    • 保护集群
      • 使用 Kerberos 实现安全的多租户
      • 使用服务账号实现安全的多租户
      • 加密内存
      • 管理数据加密密钥
      • 启用 Ranger 授权服务
      • 使用 Secret Manager 凭证提供程序
      • 创建 Hive metastore 集群并确保其安全
    • 创建自定义限制条件
    • Assured Workloads
    • FedRAMP 合规性
    • 使用 Kerberos
    • VPC Service Controls
    • 设置员工访问权限
  • 监控和问题排查
  • 无服务器
    • 借助依托 AI 技术的 Gemini Cloud Assist 调查工作负载
    • 监控无服务器工作负载和会话
      • 监控批处理工作负载
      • 监控交互式会话
      • Spark 指标
      • 启用数据沿袭
      • 分析文件资源用量
      • Resource Manager 审核日志
    • 排查无服务器工作负载和会话问题
      • 排查批次和会话创建失败问题
      • 排查批次和会话连接问题
  • 集群
    • 使用依托 AI 技术的 Gemini Cloud Assist 调查集群和作业
    • 监控集群和作业
      • 概览
      • Managed Service for Apache Spark 指标
      • 创建指标提醒
      • 分析文件资源用量
      • 分析日志
        • Managed Service for Apache Spark 日志
        • 作业输出日志
        • 审核日志
    • 排查集群问题
      • 查看集群诊断数据
      • 排查集群创建问题
    • 排查作业问题
      • 排查作业问题
      • 排查内存错误
      • 排查作业延迟问题
      • 查看作业历史记录
      • 排查工作流模板问题
  • GKE
    • 启用 Kubernetes 日志记录
    • 诊断 Kubernetes 集群
  • 开发者资源
  • Managed Service for Apache Spark MCP 服务器
  • 代码示例
  • 开始使用
  • Google Cloud 使用入门
  • 商品列表
  • Cloud Customer Care
  • 精选产品
  • Agent Platform
  • Apigee API Management
  • BigQuery
  • Compute Engine
  • Cloud CDN
  • Cloud Run
  • Cloud Storage
  • Cloud SQL