一、概述

Slurm 是一个开源、容错、高度可扩展的集群管理和作业调度系统,适用于大型和小型 Linux 集群。Slurm 的操作不需要修改内核,而且相对独立。作为集群工作负载管理器,slurm 有三个关键功能。首先,它在一段时间内为用户分配对资源(计算节点)的独占和/或非独占访问权,以便他们能够执行工作。其次,它提供了一个框架,用于在分配的节点集上启动、执行和监视工作(通常是一个并行作业)。最后,它通过管理挂起的工作队列来仲裁资源争用。

二、结构

如图1所示,slurm 由一个运行在每个计算节点上的 slurmd 守护进程和一个运行在管理节点上的中央 slurmctld 守护进程(带有可选的故障转移孪生节点)组成。Slurmd 守护进程提供容错的分层通信。用户命令包括: sacct、 sacctmgr、 salloc、 satta、 satch、 sbcast、 scancel、 scontrol、 scontab、 sdiag、 sh5util、 sinfo、 sprio、 squeue、 sreport、 srun、 sshare、 sstat、 strigger 和 sview。所有命令都可以在集群中的任何地方运行。

图1Slurm组件

 由这些 slurm 守护进程管理的实体(如图2所示)包括节点、 slurm 中的计算资源、分区(将节点分组为逻辑(可能重叠)集合)、作业或分配给用户的指定时间内的资源,以及作业步骤(作业步骤是作业中的一组任务(可能并行))。分区可以被视为作业队列,每个分区都有各种各样的约束,比如作业大小限制、作业时间限制、允许使用它的用户等等。按优先级排序的作业是在一个分区内分配节点,直到该分区内的资源(节点、处理器、内存等)耗尽为止。一旦一个作业被分配了一组节点,用户就能够在分配中的任何配置中以作业步骤的形式启动并行工作。例如,可以启动一个作业步骤来利用分配给该作业的所有节点,或者几个作业步骤可以独立地使用分配的一部分。

图2 Slurm实体

 三、命令

适用于所有 slurm 守护进程、命令和 API 函数。Command 选项--help 还提供了选项的简要摘要。注意,命令选项都是区分大小写的。

sacct 用于报告关于活动或已完成的工作或工作步骤的计费信息。

salloc 用于实时为作业分配资源。这通常用于分配资源和生成 shell。然后使用 shell 执行 srun 命令来启动并行任务。

sattach 用于将标准输入、输出和错误加信号功能附加到当前正在运行的作业或作业步骤。可以多次附加到作业并从作业分离。

sbatch 用于提交作业脚本,以便以后执行。该脚本通常包含一个或多个用于启动并行任务的 srun 命令。

sbcast 用于将文件从本地磁盘传输到作业运行节点的本地磁盘。这可以用来有效地使用无磁盘计算节点,或者相对于共享文件系统提供更好的性能。

scancel 用于取消挂起的、正在运行的作业或作业步骤。它还可以用来向与正在运行的作业或作业步骤相关联的所有进程发送任意信号。

scontrol 是用于查看和/或修改 slurm 状态的管理工具。注意,许多 scontrol 命令只能以用户 root 身份执行。

sinfo 报告由 slurm 管理的分区和节点的状态。它有各种各样的筛选、排序和格式化选项。

sprio 用于显示影响作业优先级的组件的详细视图。

squeue 报告作业或作业步骤的状态。它有各种各样的筛选、排序和格式化选项。默认情况下,它按优先级顺序报告正在运行的作业,然后按优先级顺序报告挂起的作业。

srun 用于提交要执行的作业或实时启动作业步骤。srun 有各种各样的选项来指定资源需求,包括: 最小和最大节点数、处理器数、要使用或不使用的特定节点,以及特定节点特性(多少的内存、磁盘空间、某些必需特性等)。一个作业可以包含多个作业步骤,这些作业步骤在作业节点分配的独立或共享资源上顺序或并行执行。

sshare 显示集群上公平共享使用关于的详细信息。请注意,这只有在使用优先级/多因素插件时才可行。

sstat 用于获取正在运行的作业或作业步骤所使用的资源的关于。

strigger 用于设置、获取或查看事件触发器。事件触发器包括节点下线或接近时间限制的作业等情况。

sview 是一个图形用户界面,用于获取和更新由 slurm 管理的作业、分区和节点的状态信息。

四、举例

 首先,我们确定系统上存在哪些分区,它们包含哪些节点,以及一般的系统状态。此信息由 sinfo 命令提供。在下面的例子中,我们发现有两个分区: debug和batch。debug分区后面的 * 表示这是提交作业的默认分区。我们看到两个分区都处于 UP 状态。一些配置可能包括用于除周末或晚上之外关闭的较大作业的分区。每个分区的关于信息可以分割成多行,以便能够识别不同状态的节点。在这种情况下,两个节点 adev[1-2]被关闭。down* 表示节点没有响应。请注意,节点名称规范使用了一个简洁的表达式,前缀为 adev,范围为数字,或者标识了特定的数字。这种格式允许轻松地管理非常大的集群。sinfo 命令有很多选项,可以让您轻松地以任何喜欢的格式查看感兴趣的信息。有关更多信息,请参见手册页。

adev0: sinfo
PARTITION AVAIL  TIMELIMIT NODES  STATE NODELIST
debug*       up      30:00     2  down* adev[1-2]
debug*       up      30:00     3   idle adev[3-5]
batch        up      30:00     3  down* adev[6,13,15]
batch        up      30:00     3  alloc adev[7-8,14]
batch        up      30:00     4   idle adev[9-12]

接下来,我们使用 squue 命令确定系统上存在哪些作业。ST 字段是作业状态。两个作业处于运行状态(R 是“运行”的缩写) ,而一个作业处于挂起状态(PD 是“挂起”的缩写)。TIME 字段显示使用 日-小时:分钟:秒 格式的作业运行了多长时间。NODELIST (REASON)字段指示作业正在运行的位置或作业仍然挂起的原因。挂起作业的典型原因是资源(等待资源变得可用)和优先级(排在较高优先级作业后面)。squeue 命令有许多选项,可以让您轻松地以自己喜欢的任何格式查看感兴趣的信息。有关更多信息,请参见手册页。

adev0: squeue
JOBID PARTITION  NAME  USER ST  TIME NODES NODELIST(REASON)
65646     batch  chem  mike  R 24:19     2 adev[7-8]
65647     batch   bio  joan  R  0:09     1 adev14
65648     batch  math  phil PD  0:00     6 (Resources)

 Scontrol 命令可用于报告节点、分区、作业、作业步骤和配置等关于的更详细信息。系统管理员也可以使用它进行配置更改。下面显示了两个示例。有关更多信息,请参见手册页。

adev0: scontrol show partition
PartitionName=debug TotalNodes=5 TotalCPUs=40 RootOnly=NO
   Default=YES OverSubscribe=FORCE:4 PriorityTier=1 State=UP
   MaxTime=00:30:00 Hidden=NO
   MinNodes=1 MaxNodes=26 DisableRootJobs=NO AllowGroups=ALL
   Nodes=adev[1-5] NodeIndices=0-4

PartitionName=batch TotalNodes=10 TotalCPUs=80 RootOnly=NO
   Default=NO OverSubscribe=FORCE:4 PriorityTier=1 State=UP
   MaxTime=16:00:00 Hidden=NO
   MinNodes=1 MaxNodes=26 DisableRootJobs=NO AllowGroups=ALL
   Nodes=adev[6-15] NodeIndices=5-14


adev0: scontrol show node adev1
NodeName=adev1 State=DOWN* CPUs=8 AllocCPUs=0
   RealMemory=4000 TmpDisk=0
   Sockets=2 Cores=4 Threads=1 Weight=1 Features=intel
   Reason=Not responding [slurm@06/02-14:01:24]

65648     batch  math  phil PD  0:00     6 (Resources)
adev0: scontrol show job
JobId=65672 UserId=phil(5136) GroupId=phil(5136)
   Name=math
   Priority=4294901603 Partition=batch BatchFlag=1
   AllocNode:Sid=adev0:16726 TimeLimit=00:10:00 ExitCode=0:0
   StartTime=06/02-15:27:11 EndTime=06/02-15:37:11
   JobState=PENDING NodeList=(null) NodeListIndices=
   NumCPUs=24 ReqNodes=1 ReqS:C:T=1-65535:1-65535:1-65535
   OverSubscribe=1 Contiguous=0 CPUs/task=0 Licenses=(null)
   MinCPUs=1 MinSockets=1 MinCores=1 MinThreads=1
   MinMemory=0 MinTmpDisk=0 Features=(null)
   Dependency=(null) Account=(null) Requeue=1
   Reason=None Network=(null)
   ReqNodeList=(null) ReqNodeListIndices=
   ExcNodeList=(null) ExcNodeListIndices=
   SubmitTime=06/02-15:27:11 SuspendTime=None PreSusTime=0
   Command=/home/phil/math
   WorkDir=/home/phil

 可以使用 srun 命令在单个命令行中创建资源分配并启动作业步骤的任务。根据所使用的 MPI 实现,MPI 作业也可以以这种方式启动。有关更多 MPI 特定信息,请参见 MPI 部分。在本例中,我们在三个节点(- N3)上执行/bin/hostname,并在输出(- l)上包含任务编号。将使用默认分区。默认情况下,每个节点将使用一个任务。注意,srun 命令有许多选项可用于控制分配什么资源以及如何在这些资源之间分配任务。

adev0: srun -N3 -l /bin/hostname
0: adev3
1: adev4
2: adev5

 前面示例的变体在四个任务(- n4)中执行/bin/hostname。默认情况下,每个任务使用一个处理器(注意,我们没有指定节点数)。

adev0: srun -n4 -l /bin/hostname
0: adev3
1: adev3
2: adev3
3: adev3

一种常见的操作模式是提交脚本以供以后执行。在这个示例中,脚本名称是 my.script,我们显式地使用节点 adev9和 adev10(- w“ adev [9-10]”,注意使用了节点范围表达式)。我们还明确指出,随后的作业步骤将分别产生四个任务,这将确保我们的分配包含至少四个处理器(每个要启动的任务一个处理器)。输出将出现在文件 my.stdout (“-o my.stdout”)中。此脚本包含嵌入在其中的作业的时间限制。其他选项可以根据需要提供,方法是使用前缀“ # SBATCH”,后跟脚本开头的选项(在脚本中执行任何命令之前)。命令行上提供的选项将覆盖脚本中指定的任何选项。注意,my.script 包含在分配的第一个节点(脚本运行的地方)上执行的命令/bin/hostname,以及使用 srun 命令启动并按顺序执行的两个作业步骤。

adev0: cat my.script
#!/bin/sh
#SBATCH --time=1
/bin/hostname
srun -l /bin/hostname
srun -l /bin/pwd

adev0: sbatch -n4 -w "adev[9-10]" -o my.stdout my.script
sbatch: Submitted batch job 469

adev0: cat my.stdout
adev9
0: adev9
1: adev9
2: adev10
3: adev10
0: /home/jette
1: /home/jette
2: /home/jette
3: /home/jette

最后一种操作模式是创建资源分配,并在该分配中产生作业步骤。Salloc 命令用于创建资源分配,并通常在该分配中启动 shell。一个或多个作业步骤通常会在该分配中使用 srun 命令执行,以启动任务(根据所使用的 MPI 类型,启动机制可能不同,请参阅下面的 MPI 详细信息)。最后,使用 exit 命令终止由 salloc 创建的 shell。Slurm 不会自动将可执行文件或数据文件迁移到分配给作业的节点。文件必须存在于本地磁盘或某个全局文件系统(例如 NFS 或 Lustre)中。我们提供 sbcast 工具,使用 slurm 的分层通信将文件传输到分配节点上的本地存储器。在本例中,我们使用 sbcast 将可执行程序 a.out 传输到所分配节点的本地存储上的/tmp/joe.a.out。执行程序后,我们从本地存储中删除它

tux0: salloc -N1024 bash
$ sbcast a.out /tmp/joe.a.out
Granted job allocation 471
$ srun /tmp/joe.a.out
Result is 3.14159
$ srun rm /tmp/joe.a.out
$ exit
salloc: Relinquishing job allocation 471

 在本例中,我们提交一个批作业,获取其状态并取消它。

adev0: sbatch test
srun: jobid 473 submitted

adev0: squeue
JOBID PARTITION NAME USER ST TIME  NODES NODELIST(REASON)
  473 batch     test jill R  00:00 1     adev9

adev0: scancel 473

adev0: squeue
JOBID PARTITION NAME USER ST TIME  NODES NODELIST(REASON)

五、最佳实践

考虑将相关工作放在一个单一的 slurm 工作中,同时包含多个工作步骤,这既是出于绩效考虑,也是为了便于管理。每个 slurm 作业可以包含多个作业步骤,管理作业步骤的 slurm 开销远低于单个作业的开销。

作业数组是管理具有相同资源需求的批作业集合的有效机制。大多数 slurm 命令可以将作业数组管理为单个元素(任务)或单个实体(例如,在单个命令中删除整个作业数组)。

5.1 MPI

MPI 的使用取决于所使用的 MPI 的类型。这些不同的 MPI 实现使用三种根本不同的操作模式。

1、Slurm 直接启动任务,并通过 PMI2或 PMIx API 执行通信初始化。(由大多数现代 MPI 实现支持。)

2、Slurm 为作业创建一个资源分配,然后 mpirun 使用 slurm 的基础设施(旧版本的 OpenMPI)启动任务。

3、Slurm 为作业创建一个资源分配,然后 mpirun 使用除 slurm 之外的其他机制(如 SSH 或 RSH)启动任务。这些任务是在 slurm 的监视或控制之外发起的。当作业的分配被放弃时,slurm 的 pilog 应该被配置为清除这些任务。强烈建议使用 pam _ slurm _ opt。

下面提供了将多种 MPI 与 Slurm 结合使用的说明的链接。

以下连结载有使用多种 MPI slurm 的说明。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐