編集不可のページ History 添付ファイル

 

TUT HPC Cluster Wiki: "ClusterSystemTips"の差分

16と40のリビジョン間の差分 (その間の編集: 24回)
2017-09-20 09:53:22時点のリビジョン16
サイズ: 5806
編集者: my016
コメント:
2026-07-23 10:12:01時点のリビジョン40
サイズ: 7958
編集者: yi041
コメント:
削除された箇所はこのように表示されます。 追加された箇所はこのように表示されます。
行 3: 行 3:
[Japanese|[[en/ClusterSystemTips|English]]]
行 4: 行 6:
行 7: 行 8:
<<TableOfContents(maxdepth=3)>>
行 8: 行 11:

研究ユーザの情報交換用メーリングリストの過去ログは,
http://lists.imc.tut.ac.jp/pipermail/research-users/
で見れます.
研究ユーザの情報交換用メーリングリストの過去ログは, http://lists.imc.tut.ac.jp/pipermail/research-users/ で見れます.
行 14: 行 14:

プロセスが使用したリソース(メモリ使用量など)は GNU 版 time コマンド(/usr/bin/time)で計測できます.オプション -v を利用することで,以下のようにプロセスが使用したリソースの詳細が表示されます([[http://linuxjm.osdn.jp/html/LDP_man-pages/man1/time.1.html|Man page of TIME]])
プロセスが使用したリソース(メモリ使用量など)は GNU 版 time コマンド(/usr/bin/time)で計測できます.オプション -v を利用することで,以下のようにプロセスが使用したリソースの詳細が表示されます.
行 18: 行 17:
-bash-4.1$ /usr/bin/time --version $ /usr/bin/time --version
行 21: 行 20:
-bash-4.1$ /usr/bin/time -v whoami
my016
        Comma
nd being timed: "whoami"
        User time (seconds): 0.00
        System time (seconds): 0.00
        Percent of CPU this job got: 0%
        Elapsed (wall clock) time (h:mm:ss or m:ss): 0:00.00
$ /usr/bin/time -v perl -e '"x" x 400 x 1024 x 1024'
        Comm
and being timed: "perl -e "x" x 400 x 1024 x 1024"
        User time (seconds): 0.08
        System time (seconds): 0.15
        Percent of CPU this job got: 98%
        Elapsed (wall clock) time (h:mm:ss or m:ss): 0:00.24
行 32: 行 30:
        Maximum resident set size (kbytes): 3088         Maximum resident set size (kbytes): 411772
行 35: 行 33:
        Minor (reclaiming a frame) page faults: 243
        Voluntary context switches: 3
        Minor (reclaiming a frame) page faults: 47885
        Voluntary context switches: 15
行 46: 行 44:

$ /usr/bin/time -f %M perl -e '"x" x 400 x 1024 x 1024'
411900
行 47: 行 48:

メモリの使用量は Maximum resident set size で知ることができますが, v1.7 には実際の4倍で表示されるという既知のバグ(実使用量は表示された値の4分の1)があります([[http://qiita.com/guicho271828/items/2ad3df13e915ecbb9cac|GNU Time にある壮大なバグ]]).
メモリの使用量は Maximum resident set size で知ることができます.また, -f %M を指定することでメモリの使用量のみを出力することもできます.
行 52: 行 52:
== 投入しているジョブの一括削除 ==

一般のユーザには qdel コマンドのオプション all が許可されていないように見えるものの,実際は投入している全てのジョブを削除することができます.

{{{
-bash-4.1$ qdel all
}}}

== 任意のコマンドをジョブ投入するスクリプト ==

qsub コマンドの -v オプションを利用すると,実行スクリプトに任意の環境変数を渡すことができます.この機能を利用し,演算ノードに任意のコマンドを実行できるようにしたものが以下のスクリプトです.なお,標準エラー出力は標準出力とともに出力し(-j oe),実行時間及び実行ノードを記録するためのコマンド(date, hostname)も含まれています.

{{{#!highlight sh
#!/bin/bash
#PBS -l nodes=1:ppn=1
#PBS -q wLrchq
#PBS -j oe

cd $PBS_O_WORKDIR

date
hostname
echo "$JOB_CMD"
eval "$JOB_CMD"
date
}}}

実行スクリプトを qsub.sh としたとき,以下のように JOB_CMD に任意のコマンドを指定してジョブを投入します.

{{{
-bash-4.1$ qsub -v JOB_CMD="/usr/bin/time -v perl i_love_cats.pl" qsub.sh

-bash-4.1$ qsub -v JOB_CMD="perl catching_cats.pl | perl counting_cats.pl" qsub.sh
}}}

== キューにあるすべてのユーザのジョブ一覧 ==

{{{/usr/local/maui/bin/showq}}} コマンドを使うと,キューにある他のユーザも含めたジョブ一覧を確認することができます.

行 93: 行 53:
行 105: 行 64:

開発ノ
には ulimit による cpu time の制限が存在します.この制限値は time コマンドで表示される値とは異なる値(隠れた値)に対して適用されるようです.原因のよくわからない「強制終了」が発生した場合,この制限が原因である可能性があります.例えば,大量のデータを rsync で同期すると以下のようなエラーが発生します.
窓口サには ulimit による cpu time の制限が存在します.この制限値は time コマンドで表示される値とは異なる値(隠れた値)に対して適用されるようです.原因のよくわからない「強制終了」が発生した場合,この制限が原因である可能性があります.例えば,大量のデータを rsync で同期すると以下のようなエラーが発生します.
行 118: 行 76:
rsync が消費する cpu time は --bwlimit の指定に関係なく,概ねデータ転送量で決まるようです.リモート同期の場合は ssh による経路暗号化処理が入るため,ローカル同期よりも cpu time を2倍程度消費する傾向にあります.
行 119: 行 78:
rsync が消費する cpu time は --bwlimit の指定に関係なく,概ねデータ転送量で決まるようです.リモート同期の場合は ssh による経路暗号化処理が入るため,ローカル同期よりも cpu time を2倍程度消費する傾向にあります. == singularityコンテナ内からジョブスケジューラを利用 ==

窓口サーバにログインしてからsingularity-pbsのスクリプトを利用してコンテナを立ち上げることで,qsubやqstatなどのジョブスケジューラのコマンドを実行できます.以下は計算サーバでのジョブ用に用意されているコンテナを指定した例です.

{{{
[yi041@ydev04 ~]$ sudo /usr/local/bin/singularity-pbs /common/Singularity_sif/prg_env_amd_2025.02.sif
}}}

== ANSYS が実行できない場合(窓口サーバxdev,計算ノードxsndの場合) ==

■端末を2つ開き,端末1と端末2にて同じxdev(例:xdev09.edu.tut.ac.jp)に接続する

{{{
端末1:$ ssh -X xdev09.edu.tut.ac.jp -l IMCアカウント
端末2:$ ssh -X xdev09.edu.tut.ac.jp -l IMCアカウント
}}}
■ターミナル1にて別の任意のxdev(例:xdev08.edu.tut.ac.jp)に接続する

{{{
端末1:$ ssh -X xdev08
}}}
■端末1にてコンテナを起動する

{{{
[es006@xdev08 ~]$ qsub -q wEduq -I -X -l select=1:ncpus=2:mem=8g:ngpus=0:vnode=xsnd01 -v DOCKER_IMAGE=prg-env:2019.10.03
qsub: waiting for job 853714.xregistry0 to start
qsub: job 853714.xregistry0 ready

Access Port:
        <proto>://133.15.52.213:6048/ -> container port 22

[es006@xsnd01-853714-xregistry0 es006]$ hostname
xsnd01-853714-xregistry0
[es006@xsnd01-853714-xregistry0 es006]$ env |grep DISPLAY
DISPLAY=localhost:50.0
}}}
■最後のCookie値を確認

{{{
[es006@xsnd01-853714-xregistry0 es006]$ xauth list |grep :50
xsnd07.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 d87479acccfef58985781b575f3d4eb4
xsnd04.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 34c0617d410bafafa162a350aa55db0a
xsnd00.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 ee073eccf8726d2e97896ed6363ebe11
xsnd03.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 ee073eccf8726d2e97896ed6363ebe11
xsnd02.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 13cee90ba6b5e5b375a25bd40cf2ea34
xsnd01.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 01c509a89b41a533f80d7f86a9711f3d ←★これ
}}}
■端末2でxauth add を行う

{{{
[es006@xdev09 ~]$ xauth add xsnd01-853714-xregistry0/unix:50 MIT-MAGIC-COOKIE-1 01c509a89b41a533f80d7f86a9711f3d
}}}
■端末1で追加されたことを確認

{{{
[es006@xsnd01-853714-xregistry0 es006]$ xauth list |grep :50
xsnd07.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 d87479acccfef58985781b575f3d4eb4
xsnd04.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 34c0617d410bafafa162a350aa55db0a
xsnd00.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 ee073eccf8726d2e97896ed6363ebe11
xsnd03.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 ee073eccf8726d2e97896ed6363ebe11
xsnd02.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 13cee90ba6b5e5b375a25bd40cf2ea34
xsnd01.edu.tut.ac.jp/unix:50 MIT-MAGIC-COOKIE-1 01c509a89b41a533f80d7f86a9711f3d
xsnd01-853714-xregistry0/unix:50 MIT-MAGIC-COOKIE-1 01c509a89b41a533f80d7f86a9711f3d ←★これ
}}}
■端末1でANSYS起動 ※時間がかかります

{{{
[es006@xsnd01-853714-xregistry0 es006]$ module load ansys19.r2
[es006@xsnd01-853714-xregistry0 es006]$ /common/ansys_hfss-19.r2/AnsysEM19.4/Linux64/ansysedt
ANSYS Electromagnetics 19.4 Configuration
=========================================
Hostname: xsnd01-853714-xregistry0
User: es006

> Running first-time configuration...
  - Verifying all software dependencies are available:
Done

  - Retrieving user settings... Done
  - Applying user settings... Done
  - Configuring OCX files... Done
  - Retrieving machine settings... Done
  - Applying machine settings... Done
  - Configuring binaries... Done
First-time configuration completed successfully.
}}}

[Japanese|English]

クラスタシステム利用の Tips

クラスタシステム利用にあたって気づいた便利なノウハウなどの記入をお願いします.ログインすることで編集できるようになります.

研究ユーザ情報交換用メーリングリストの過去ログ

研究ユーザの情報交換用メーリングリストの過去ログは, http://lists.imc.tut.ac.jp/pipermail/research-users/ で見れます.

使用リソース(メモリ使用量など)の計測

プロセスが使用したリソース(メモリ使用量など)は GNU 版 time コマンド(/usr/bin/time)で計測できます.オプション -v を利用することで,以下のようにプロセスが使用したリソースの詳細が表示されます.

$ /usr/bin/time --version
GNU time 1.7

$ /usr/bin/time -v perl -e '"x" x 400 x 1024 x 1024'
        Command being timed: "perl -e "x" x 400 x 1024 x 1024"
        User time (seconds): 0.08
        System time (seconds): 0.15
        Percent of CPU this job got: 98%
        Elapsed (wall clock) time (h:mm:ss or m:ss): 0:00.24
        Average shared text size (kbytes): 0
        Average unshared data size (kbytes): 0
        Average stack size (kbytes): 0
        Average total size (kbytes): 0
        Maximum resident set size (kbytes): 411772
        Average resident set size (kbytes): 0
        Major (requiring I/O) page faults: 0
        Minor (reclaiming a frame) page faults: 47885
        Voluntary context switches: 15
        Involuntary context switches: 1
        Swaps: 0
        File system inputs: 0
        File system outputs: 0
        Socket messages sent: 0
        Socket messages received: 0
        Signals delivered: 0
        Page size (bytes): 4096
        Exit status: 0

$ /usr/bin/time -f %M perl -e '"x" x 400 x 1024 x 1024'
411900

メモリの使用量は Maximum resident set size で知ることができます.また, -f %M を指定することでメモリの使用量のみを出力することもできます.

GNU 版 time コマンドはクラスタの演算ノードでも利用できますが,結果が標準エラー出力であることに留意する必要があります.

ジョブの実行状態を繰り返し表示

投入したジョブがどのような状況かを表示する場合には, watch コマンドを併用すると便利です.以下のように実行すると,5秒間隔で繰り返し実行され,常に最新の状態を把握することができます.また,オプション -d を指定すると,前回との差分がハイライトされます.なお,繰り返し実行するコマンドにエイリアスは指定できません.

-bash-4.1$ watch -n 5 qstat -a

-bash-4.1$ watch -n 5 qstat -Q

-bash-4.1$ watch -n 5 -d qstat -Q

ulimit -t (cpu time) による制限

窓口サーバには ulimit による cpu time の制限が存在します.この制限値は time コマンドで表示される値とは異なる値(隠れた値)に対して適用されるようです.原因のよくわからない「強制終了」が発生した場合,この制限が原因である可能性があります.例えば,大量のデータを rsync で同期すると以下のようなエラーが発生します.

-bash-4.1$ rsync --progress -avh /tmp/source /destination/
sending incremental file list

...

rsync: writefd_unbuffered failed to write 4 bytes to socket [sender]: Broken pipe (32)
rsync: connection unexpectedly closed (96 bytes received so far) [sender]
rsync error: error in rsync protocol data stream (code 12) at io.c(600) [sender=3.0.6]

rsync が消費する cpu time は --bwlimit の指定に関係なく,概ねデータ転送量で決まるようです.リモート同期の場合は ssh による経路暗号化処理が入るため,ローカル同期よりも cpu time を2倍程度消費する傾向にあります.

singularityコンテナ内からジョブスケジューラを利用

窓口サーバにログインしてからsingularity-pbsのスクリプトを利用してコンテナを立ち上げることで,qsubやqstatなどのジョブスケジューラのコマンドを実行できます.以下は計算サーバでのジョブ用に用意されているコンテナを指定した例です.

[yi041@ydev04 ~]$ sudo /usr/local/bin/singularity-pbs /common/Singularity_sif/prg_env_amd_2025.02.sif

ANSYS が実行できない場合(窓口サーバxdev,計算ノードxsndの場合)

■端末を2つ開き,端末1と端末2にて同じxdev(例:xdev09.edu.tut.ac.jp)に接続する

端末1:$ ssh -X xdev09.edu.tut.ac.jp -l IMCアカウント
端末2:$ ssh -X xdev09.edu.tut.ac.jp -l IMCアカウント

■ターミナル1にて別の任意のxdev(例:xdev08.edu.tut.ac.jp)に接続する

端末1:$ ssh -X xdev08

■端末1にてコンテナを起動する

[es006@xdev08 ~]$ qsub -q wEduq -I -X -l select=1:ncpus=2:mem=8g:ngpus=0:vnode=xsnd01 -v DOCKER_IMAGE=prg-env:2019.10.03
qsub: waiting for job 853714.xregistry0 to start
qsub: job 853714.xregistry0 ready

Access Port:
        <proto>://133.15.52.213:6048/ -> container port 22

[es006@xsnd01-853714-xregistry0 es006]$ hostname
xsnd01-853714-xregistry0
[es006@xsnd01-853714-xregistry0 es006]$ env |grep DISPLAY
DISPLAY=localhost:50.0

■最後のCookie値を確認

[es006@xsnd01-853714-xregistry0 es006]$ xauth list |grep :50
xsnd07.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  d87479acccfef58985781b575f3d4eb4
xsnd04.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  34c0617d410bafafa162a350aa55db0a
xsnd00.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  ee073eccf8726d2e97896ed6363ebe11
xsnd03.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  ee073eccf8726d2e97896ed6363ebe11
xsnd02.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  13cee90ba6b5e5b375a25bd40cf2ea34
xsnd01.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  01c509a89b41a533f80d7f86a9711f3d ←★これ

■端末2でxauth add を行う

[es006@xdev09 ~]$ xauth add xsnd01-853714-xregistry0/unix:50  MIT-MAGIC-COOKIE-1  01c509a89b41a533f80d7f86a9711f3d

■端末1で追加されたことを確認

[es006@xsnd01-853714-xregistry0 es006]$ xauth list |grep :50
xsnd07.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  d87479acccfef58985781b575f3d4eb4
xsnd04.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  34c0617d410bafafa162a350aa55db0a
xsnd00.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  ee073eccf8726d2e97896ed6363ebe11
xsnd03.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  ee073eccf8726d2e97896ed6363ebe11
xsnd02.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  13cee90ba6b5e5b375a25bd40cf2ea34
xsnd01.edu.tut.ac.jp/unix:50  MIT-MAGIC-COOKIE-1  01c509a89b41a533f80d7f86a9711f3d
xsnd01-853714-xregistry0/unix:50  MIT-MAGIC-COOKIE-1  01c509a89b41a533f80d7f86a9711f3d ←★これ

■端末1でANSYS起動 ※時間がかかります

[es006@xsnd01-853714-xregistry0 es006]$ module load ansys19.r2
[es006@xsnd01-853714-xregistry0 es006]$ /common/ansys_hfss-19.r2/AnsysEM19.4/Linux64/ansysedt
ANSYS Electromagnetics 19.4 Configuration
=========================================
Hostname: xsnd01-853714-xregistry0
User:     es006

> Running first-time configuration...
  - Verifying all software dependencies are available:
Done

  - Retrieving user settings... Done
  - Applying user settings... Done
  - Configuring OCX files... Done
  - Retrieving machine settings... Done
  - Applying machine settings... Done
  - Configuring binaries... Done
First-time configuration completed successfully.