ESXi 8.0 FreeでNVMe SSDの温度を確認する

ESXi 8.0 Free環境で、NVMe SSDの温度が取得できるのかを確認してみた

まず情報源は「Commands to Display S.M.A.R.T. Data for NVMe Devices in ESXi

S.M.A.R.T.データの読み出しを行うコマンドがある、と

NVMe系コマンド操作で情報取得する場合

まず、NVMeストレージの一覧を確認

[root@esxi:~] esxcli nvme device list
HBA Name  Status  Signature
--------  ------  ---------
vmhba1    Online  nvmeMgmt-nvmhba0
vmhba0    Online  nvmeMgmt-nvmhba1
[root@esxi:~]

この環境には2つのNVMe SSDがあるので、2個表示される

1個目を確認

[root@esxi:~] esxcli nvme device log smart get -A vmhba0
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 318 K
   Available Spare: 100 %
   Available Spare Threshold: 10 %
   Percentage Used: 0 %
   Data Units Read: 0x281ea0
   Data Units Written: 0x27e613
   Host Read Commands: 0x145c04f
   Host Write Commands: 0x161ca45
   Controller Busy Time: 0xa37
   Power Cycles: 0xb4
   Power On Hours: 0x608
   Unsafe Shutdowns: 0xf
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x0
   Warning Composite Temperature Time: 12 Mins
   Critical Composite Temperature Time: 1001 Mins
   Temperature Sensor 1: 0 K
   Temperature Sensor 2: 0 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~]

Composite Temperatureの値はあるが、Temperature Sensorの値が全部なし

これは、怪しいメーカ製のNVMe SSD(TWSC TSC1BN2562DF7T10A)であることに由来していると思われる

じゃあ、2個目(SPD SP7002D2TNGH)は?

[root@esxi:~] esxcli nvme device log smart get -A vmhba1
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 316 K
   Available Spare: 100 %
   Available Spare Threshold: 1 %
   Percentage Used: 1 %
   Data Units Read: 0x1c706ba
   Data Units Written: 0x2fd6fe3
   Host Read Commands: 0x21811d5a
   Host Write Commands: 0x2509be1b
   Controller Busy Time: 0x891
   Power Cycles: 0xc7
   Power On Hours: 0x6db
   Unsafe Shutdowns: 0x14
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x1
   Warning Composite Temperature Time: 3522 Mins
   Critical Composite Temperature Time: 1912 Mins
   Temperature Sensor 1: 316 K
   Temperature Sensor 2: 308 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~]

こちらは2個のセンサーが設定されていた

ストレージ操作として情報を取得する場合

ストレージデバイス一覧を取得

[root@esxi:~] esxcli storage core device list
t10.NVMe____TWSC_TSC1BN2562DF7T10A___________________0000000000010000
   Display Name: Local NVMe Disk (t10.NVMe____TWSC_TSC1BN2562DF7T10A___________________0000000000010000)
   Has Settable Display Name: true
   Size: 244198
   Device Type: Direct-Access
   Multipath Plugin: HPP
   Devfs Path: /vmfs/devices/disks/t10.NVMe____TWSC_TSC1BN2562DF7T10A___________________0000000000010000
   Vendor: NVMe
   Model: TWSC TSC1BN256-F7T10A
   Revision: T1103N0L
   SCSI Level: 0
   Is Pseudo: false
   Status: on
   Is RDM Capable: false
   Is Local: true
   Is Removable: false
   Is SSD: true
   Is VVOL PE: false
   Is Offline: false
   Is Perennially Reserved: false
   Queue Full Sample Size: 0
   Queue Full Threshold: 0
   Thin Provisioning Status: no
   Attached Filters:
   VAAI Status: unsupported
   Other UIDs: vml.05382b44a545e29308c99c2e0ef990edeaa5ba7d16ef3c2ae03a9befc3814afd0d
   Is Shared Clusterwide: false
   Is SAS: false
   Is USB: false
   Is Boot Device: true
   Device Max Queue Depth: 255
   No of outstanding IOs with competing worlds: 32
   Drive Type: physical
   RAID Level: NA
   Number of Physical Drives: 1
   Protection Enabled: false
   PI Activated: false
   PI Type: 0
   PI Protection Mask: NO PROTECTION
   Supported Guard Types: NO GUARD SUPPORT
   DIX Enabled: false
   DIX Guard Type: NO GUARD SUPPORT
   Emulated DIX/DIF Enabled: false

t10.NVMe____SPD_SP7002D2TNGH_________________________0200000000000000
   Display Name: Local NVMe Disk (t10.NVMe____SPD_SP7002D2TNGH_________________________0200000000000000)
   Has Settable Display Name: true
   Size: 1953514
   Device Type: Direct-Access
   Multipath Plugin: HPP
   Devfs Path: /vmfs/devices/disks/t10.NVMe____SPD_SP7002D2TNGH_________________________0200000000000000
   Vendor: NVMe
   Model: SPD SP700-2TNGH
   Revision: SP02203A
   SCSI Level: 0
   Is Pseudo: false
   Status: on
   Is RDM Capable: false
   Is Local: true
   Is Removable: false
   Is SSD: true
   Is VVOL PE: false
   Is Offline: false
   Is Perennially Reserved: false
   Queue Full Sample Size: 0
   Queue Full Threshold: 0
   Thin Provisioning Status: no
   Attached Filters:
   VAAI Status: unsupported
   Other UIDs: vml.05c56298c6cae09f64ef49957d1d7af93c98b2a5792c87d191b47f87ea5b89f9e2
   Is Shared Clusterwide: false
   Is SAS: false
   Is USB: false
   Is Boot Device: false
   Device Max Queue Depth: 1023
   No of outstanding IOs with competing worlds: 32
   Drive Type: physical
   RAID Level: NA
   Number of Physical Drives: 1
   Protection Enabled: false
   PI Activated: false
   PI Type: 0
   PI Protection Mask: NO PROTECTION
   Supported Guard Types: NO GUARD SUPPORT
   DIX Enabled: false
   DIX Guard Type: NO GUARD SUPPORT
   Emulated DIX/DIF Enabled: false
[root@esxi:~]

各デバイスのS.M.A.R.T情報を取得

[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____TWSC_TSC1BN256
2DF7T10A___________________0000000000010000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1544   N/A        N/A    N/A
Power Cycle Count         180    N/A        N/A    N/A
Reallocated Sector Count  0      90         N/A    N/A
Drive Temperature         43     83         N/A    N/A
[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____SPD_SP7002D2TN
GH_________________________0200000000000000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1755   N/A        N/A    N/A
Power Cycle Count         199    N/A        N/A    N/A
Reallocated Sector Count  0      99         N/A    N/A
Drive Temperature         43     90         N/A    N/A
[root@esxi:~]

「Drive Temperature」に温度は入っている

検証

ここまではNVMe SSDのヒートシンクに向けて冷却ファンが稼働している状態で実行していた

冷却ファンを止めて温度上昇が発生するのかを検証

[root@esxi:~] esxcli nvme device log smart get -A vmhba0
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 324 K
   Available Spare: 100 %
   Available Spare Threshold: 10 %
   Percentage Used: 0 %
   Data Units Read: 0x281fc3
   Data Units Written: 0x27e69c
   Host Read Commands: 0x145f45c
   Host Write Commands: 0x16201bc
   Controller Busy Time: 0xa38
   Power Cycles: 0xb4
   Power On Hours: 0x60a
   Unsafe Shutdowns: 0xf
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x0
   Warning Composite Temperature Time: 12 Mins
   Critical Composite Temperature Time: 1001 Mins
   Temperature Sensor 1: 0 K
   Temperature Sensor 2: 0 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____TWSC_TSC1BN256
2DF7T10A___________________0000000000010000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1546   N/A        N/A    N/A
Power Cycle Count         180    N/A        N/A    N/A
Reallocated Sector Count  0      90         N/A    N/A
Drive Temperature         52     83         N/A    N/A
[root@esxi:~] esxcli nvme device log smart get -A vmhba1
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 317 K
   Available Spare: 100 %
   Available Spare Threshold: 1 %
   Percentage Used: 1 %
   Data Units Read: 0x1c71334
   Data Units Written: 0x2fd767a
   Host Read Commands: 0x2181e209
   Host Write Commands: 0x250ab10d
   Controller Busy Time: 0x891
   Power Cycles: 0xc7
   Power On Hours: 0x6dd
   Unsafe Shutdowns: 0x14
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x1
   Warning Composite Temperature Time: 3522 Mins
   Critical Composite Temperature Time: 1912 Mins
   Temperature Sensor 1: 317 K
   Temperature Sensor 2: 319 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____SPD_SP7002D2TN
GH_________________________0200000000000000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1757   N/A        N/A    N/A
Power Cycle Count         199    N/A        N/A    N/A
Reallocated Sector Count  0      99         N/A    N/A
Drive Temperature         44     90         N/A    N/A
[root@esxi:~]

2時間後

[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____TWSC_TSC1BN256
2DF7T10A___________________0000000000010000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1547   N/A        N/A    N/A
Power Cycle Count         180    N/A        N/A    N/A
Reallocated Sector Count  0      90         N/A    N/A
Drive Temperature         54     83         N/A    N/A
[root@esxi:~] esxcli nvme device log smart get -A vmhba0
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 327 K
   Available Spare: 100 %
   Available Spare Threshold: 10 %
   Percentage Used: 0 %
   Data Units Read: 0x2820c9
   Data Units Written: 0x27e737
   Host Read Commands: 0x1461a66
   Host Write Commands: 0x1622f01
   Controller Busy Time: 0xa39
   Power Cycles: 0xb4
   Power On Hours: 0x60b
   Unsafe Shutdowns: 0xf
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x0
   Warning Composite Temperature Time: 12 Mins
   Critical Composite Temperature Time: 1001 Mins
   Temperature Sensor 1: 0 K
   Temperature Sensor 2: 0 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____TWSC_TSC1BN256
2DF7T10A___________________0000000000010000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1547   N/A        N/A    N/A
Power Cycle Count         180    N/A        N/A    N/A
Reallocated Sector Count  0      90         N/A    N/A
Drive Temperature         54     83         N/A    N/A
[root@esxi:~] esxcli nvme device log smart get -A vmhba1
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 320 K
   Available Spare: 100 %
   Available Spare Threshold: 1 %
   Percentage Used: 1 %
   Data Units Read: 0x1c78f10
   Data Units Written: 0x30203c4
   Host Read Commands: 0x218425aa
   Host Write Commands: 0x2519b431
   Controller Busy Time: 0x892
   Power Cycles: 0xc7
   Power On Hours: 0x6df
   Unsafe Shutdowns: 0x14
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x1
   Warning Composite Temperature Time: 3522 Mins
   Critical Composite Temperature Time: 1912 Mins
   Temperature Sensor 1: 320 K
   Temperature Sensor 2: 334 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~] esxcli nvme device log smart get -A vmhba1
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 320 K
   Available Spare: 100 %
   Available Spare Threshold: 1 %
   Percentage Used: 1 %
   Data Units Read: 0x1c78f11
   Data Units Written: 0x3020450
   Host Read Commands: 0x218425f1
   Host Write Commands: 0x2519b834
   Controller Busy Time: 0x892
   Power Cycles: 0xc7
   Power On Hours: 0x6df
   Unsafe Shutdowns: 0x14
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x1
   Warning Composite Temperature Time: 3522 Mins
   Critical Composite Temperature Time: 1912 Mins
   Temperature Sensor 1: 320 K
   Temperature Sensor 2: 332 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____SPD_SP7002D2TN
GH_________________________0200000000000000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1759   N/A        N/A    N/A
Power Cycle Count         199    N/A        N/A    N/A
Reallocated Sector Count  0      99         N/A    N/A
Drive Temperature         47     90         N/A    N/A
[root@esxi:~]
[root@esxi:~] esxcli nvme device log smart get -A vmhba0
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 327 K
   Available Spare: 100 %
   Available Spare Threshold: 10 %
   Percentage Used: 0 %
   Data Units Read: 0x28249f
   Data Units Written: 0x27eada
   Host Read Commands: 0x146b7f3
   Host Write Commands: 0x16305bb
   Controller Busy Time: 0xa3d
   Power Cycles: 0xb4
   Power On Hours: 0x611
   Unsafe Shutdowns: 0xf
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x0
   Warning Composite Temperature Time: 12 Mins
   Critical Composite Temperature Time: 1001 Mins
   Temperature Sensor 1: 0 K
   Temperature Sensor 2: 0 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____TWSC_TSC1BN256
2DF7T10A___________________0000000000010000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1553   N/A        N/A    N/A
Power Cycle Count         180    N/A        N/A    N/A
Reallocated Sector Count  0      90         N/A    N/A
Drive Temperature         54     83         N/A    N/A
[root@esxi:~] esxcli nvme device log smart get -A vmhba1
SMART And Health Info:
   Available Spare Space Below Threshold: false
   Temperature Warning: false
   NVM Subsystem Reliability Degradation: false
   Read Only Mode: false
   Volatile Memory Backup Device Failure: false
   Composite Temperature: 321 K
   Available Spare: 100 %
   Available Spare Threshold: 1 %
   Percentage Used: 1 %
   Data Units Read: 0x1cb74d7
   Data Units Written: 0x309f82b
   Host Read Commands: 0x21a21851
   Host Write Commands: 0x2596bdff
   Controller Busy Time: 0x899
   Power Cycles: 0xc7
   Power On Hours: 0x6e5
   Unsafe Shutdowns: 0x14
   Media Errors: 0x0
   Number of Error Info Log Entries: 0x1
   Warning Composite Temperature Time: 3788 Mins
   Critical Composite Temperature Time: 1936 Mins
   Temperature Sensor 1: 321 K
   Temperature Sensor 2: 342 K
   Temperature Sensor 3: 0 K
   Temperature Sensor 4: 0 K
   Temperature Sensor 5: 0 K
   Temperature Sensor 6: 0 K
   Temperature Sensor 7: 0 K
   Temperature Sensor 8: 0 K
[root@esxi:~] esxcli storage core device smart get -d t10.NVMe____SPD_SP7002D2TN
GH_________________________0200000000000000
Parameter                 Value  Threshold  Worst  Raw
------------------------  -----  ---------  -----  ---
Health Status             OK     N/A        N/A    N/A
Power-on Hours            1765   N/A        N/A    N/A
Power Cycle Count         199    N/A        N/A    N/A
Reallocated Sector Count  0      99         N/A    N/A
Drive Temperature         48     90         N/A    N/A
[root@esxi:~]
TWSCのNVMe SSDSPDのNVMe SSD
最初318K / 43度316K / 43度
1時間後324K / 52度317K / 44度
2時間後327K / 54度320K / 47度
4時間後327K / 54度321K / 48度

ESXi 8.0 FreeでCIMサーバが起動しない

ESXi 8.0 Free環境でCIMサーバ(sfcbd-watchdog)が起動していない

コマンドでステータスを確認

[root@esxi:~] /etc/init.d/sfcbd-watchdog status
sfcbd-init[1052108]: args ('status')
sfcbd-init[1052108]: Getting Exclusive access, please wait...
sfcbd-init[1052108]: Exclusive access granted.
sfcbd is not running
[root@esxi:~]

手動で起動を試みる

[root@esxi:~] /etc/init.d/sfcbd-watchdog start
sfcbd-init[1052119]: args ('start')
sfcbd-init[1052119]: Getting Exclusive access, please wait...
sfcbd-init[1052119]: Exclusive access granted.
sfcbd-init[1052119]: Request to start sfcbd-watchdog, pid 1052119
sfcbd-init[1052119]: sfcbd not started, administratively disabled.
[root@esxi:~]

起動に失敗する

検索すると「How to enable CIM Server (WBEM service) in ESXi 8」という記事を発見

wbemを有効化すると使えるようになるらしい

まず、現状wbemがどうなっているかを確認

[root@esxi:~] esxcli system wbem get
   Enabled: false
   WS-Management Service: true
   Enable HTTPS: true
   Authorization Model: password
   Port: 5989
   HTTP Procs: 2
   HTTPS Procs: 4
   Provider Procs: 16
   Keepalive Timeout: 1
   Keepalive Max Requests: 10
   Provider Sample Interval: 30
   Provider Timeout Interval: 120
   HTTP Max Content Length: 1048576
   Max Message Length: 40000000
   Thread Stack Size: 1048576
   Provider Resource Pool Override:
   SSL Cipher List: ECDHE+AESGCM:ECDHE+AES
   Threadpool Size: 5
   Readonly: false
   Log Level: warning
   Service Location Protocol PID: 0
   WS-Management PID: 0
   CIM Object Manager PID: 0
   Enabled SSL Protocols:
   Enabled System SSL Protocols: tlsv1.2
   Enabled Running SSL Protocols:
[root@esxi:~]

「Enabled: false」なので無効状態だった

「esxcli system wbem set -e true」を実行して有効化する

[root@esxi:~] esxcli system wbem set -e true
[root@esxi:~] esxcli system wbem get
   Enabled: true
   WS-Management Service: true
   Enable HTTPS: true
   Authorization Model: password
   Port: 5989
   HTTP Procs: 2
   HTTPS Procs: 4
   Provider Procs: 16
   Keepalive Timeout: 1
   Keepalive Max Requests: 10
   Provider Sample Interval: 30
   Provider Timeout Interval: 120
   HTTP Max Content Length: 1048576
   Max Message Length: 40000000
   Thread Stack Size: 1048576
   Provider Resource Pool Override:
   SSL Cipher List: ECDHE+AESGCM:ECDHE+AES
   Threadpool Size: 5
   Readonly: false
   Log Level: warning
   Service Location Protocol PID: 1052207
   WS-Management PID: 1053086
   CIM Object Manager PID: 1053049
   Enabled SSL Protocols:
   Enabled System SSL Protocols: tlsv1.2
   Enabled Running SSL Protocols: tlsv1.2
[root@esxi:~]

で、CIMサーバの状態を確認

[root@esxi:~] /etc/init.d/sfcbd-watchdog status
sfcbd-init[1053334]: args ('status')
sfcbd-init[1053334]: Getting Exclusive access, please wait...
sfcbd-init[1053334]: Exclusive access granted.
sfcbd is running
[root@esxi:~]

勝手に起動していた

Web UI上でも起動を確認した

CIMサーバ稼働したので[ハードウェア]-[ストレージ]に情報が表示されるようになったけど、ストレージじゃないなぁ・・・

AMD Zen系CPU温度をとれるAMD Zen4/Zen5 IPMI Thermal DriverをRyzen 5 3500UのESXi 8.0 Freeにインストールしてみた

VMware Flingsを見ていたらAMD Zen4/Zen5 IPMI Thermal Driver なるものがあった

検索してみると「AMD Zen4/Zen5 IPMI Thermal Driver for ESX Fling」という記事を見つけた

それによれば、Zen4/Zen5とかいてあるがZen3も対応しているらしい

もしかしてZen+のRyzen 5 3500Uでも使えるのかな?と実験してみた

実験した環境はGMKtec NucBox G10 mini (Ryzen 5 3500U)環境で、32GBメモリ2枚増設して使っている。

まず、導入前の状態は下記の様になにもデータがない

Flingsからダウンロードしたドライバzipファイルをローカルデータストア上に配置

[root@esxi:/vmfs/volumes/~/iso] ls -l /vmfs/volumes/~/iso/VMware-amd-zen-ipmi_thermal_910.1.0.0006-5vmw.803.0.0.24022510.zip
-rw-r--r--    1 root     root         23355 Jul  8 00:32 /vmfs/volumes/~/iso/VMware-amd-zen-ipmi_thermal_910.1.0.0006-5vmw.803.0.0.24022510.zip
[root@esxi:/vmfs/volumes/~/iso]

ドライバのインストール

[root@esxi:/vmfs/volumes/~/iso] esxcli softwar
e component apply -d /vmfs/volumes/~/iso/VMwar
e-amd-zen-ipmi_thermal_910.1.0.0006-5vmw.803.0.0.24022510.zip
Installation Result
   Message: The update completed successfully, but the system needs to be rebooted for the changes to be effective.
   Components Installed: VMware-smntemp_910.1.0.0006-5vmw.803.0.0.24022510
   Components Removed:
   Components Skipped:
   Reboot Required: true
   DPU Results:
[root@esxi:/vmfs/volumes/~/iso]

ドライバインストール後はESXi再起動必須

再起動後、ステータスを確認すると、CPU温度を認識するようになった

CLIでも認識するようになった

[root@esxi:~] esxcli hardware ipmi sdr list
Node-Sensor  Description            Entity-Instance  Computed Reading  Base Unit  Raw Reading  Sensor Type  Timestamp/Comment    Raw  Formatted-Raw
-----------  ---------------------  ---------------  ----------------  ---------  -----------  -----------  -------------------  ---  -------------
0.1          Processor 1 CPU0_Tctl  3.1              59                degrees C  59           Temperature  2026-07-08T00:56:20
[root@esxi:~]

元記事ではドライバインストール後に標準では /etc/vmware/default.map.d/smntemp_extra.map ファイルを新規作成して、認識できるようにする必要がある、的な記載があるけどしなくても見れるなぁ・・・

Ryzen 5 3500Uについては /etc/vmware/default.map.d/smntemp.map の方に情報あり、と

[root@esxi:~] lspci -v | grep -A2 '0000:00:18.3'
0000:00:18.3 Bridge Host bridge: Advanced Micro Devices, Inc. [AMD] Raven/Raven2 Device 24: Function 3
         Class 0600: 1022:15eb

[root@esxi:~] cat /etc/vmware/default.map.d/smntemp.map|grep 15eb
regtype=native,bus=pci,id=102215eb..............,driver=smntemp
[root@esxi:~]

どうやら、元記事は1.0.0005時代で、今回インストールしたのは AMD Zen4/Zen5 IPMI Thermal Driver for ESX 1.0.0006 なので、そこの違いである模様

SPAM対応メモ 2026/06/24

メールサーバに新しいメールが入ってこない、というので調査したら、特定ユーザのメールパスワードがばれていてSPAM送信に使われていたという時のメモ

(1) 落ちてるデーモンはいなかった

systemctl --failed

を実行した際に止まっているものはいなかった

(2) メールのキューに異常

postfixのメールキューの状態を確認

# postqueue -p

数万通のメールが滞留していた

差出人はほぼ1ユーザで、宛先は方々にわたる

(3) メール配送停止

ひとまず、postfixのメール配送処理を止める

# postfix abort

(4) ログ確認

/var/log/messagesと/var/log/maillog に対して そのユーザ名でgrepをかけて確認

roudcubeのログにて、roundcube内から多数のメールアドレスを指定してメール送信していることを確認

(5) アクセス者IPアドレス確認

ログから該当する操作のIPアドレスを確認し、そのアドレスがどこなのかを確認

今回は3IPアドレスからきており、どれも海外

(6) あからさまにSPAMを削除

今回特定の時間帯の送信は全部SPAMっぽかったので以下のコマンドで該当ユーザのメールをpostsuper -d queueIDで削除

# for queid in `postqueue -p|grep "Jun 24 04"  |grep ユーザ名|awk '{ print $1 }' | sed s/\*//ig`; do postsuper -d $queid; done

あと、MAILER-DAEMON関連の返送処理も削除

# for queid in `postqueue -p|grep MAILER|awk '{ print $1 }' | sed s/\*//ig`; do postsuper -d $queid; done

(7) とりあえず再開


2026/07/21追記

外部への影響報告

gmailサーバでのメール受信拒否

gmailサーバからメールの受け取り拒否を食らっていました
 https://support.google.com/a/answer/172179

期間は2026/06/23 23:02~2026/07/19ぐらい?(2026/07/21 09:00には問題なかった)

SPFやDMARCなどの設定は正確に実施されているにもかかわらず、gmail側は設定に不備があるから拒否、と言い張る状態でした。

おそらくIPアドレスが同じ場合は、約30日経過しないと許可しないようです・・・

各SPAMレポートサーバでの登録

いくつかのサービスで登録はされましたが、3日程度で削除されていました。

spamcop
GBUdb.com
junkmailfilter.com
https://www.zedsd.net/blacklist.php

2日程度のメール受信拒否を食らったところ

2日程度でSPAM扱いでメール受信拒否を食らったメッセージが帰ってきたところはこんな感じです

意外だったのは、outlook.com 系から受信拒否を食らってなかったことです

hostingシステム系からのエラー
https://abuse.vadesecure.com/
https://www.strato-hosting.co.uk/faq/product/why-are-my-emails-not-being-delivered

Apple icloud.comからのエラー
 https://support.apple.com/en-us/102322

ONTAPシミュレータのaggregateが見えなくなった

ESXi上に構築したONTAP シミュレータで データ用のaggregateにあるvolumeが見えなくなった

確認したところ、aggregateの状態が「restricted」となっていた

netapp::> storage aggregate show


Aggregate     Size Available Used% State   #Vols  Nodes            RAID Status
--------- -------- --------- ----- ------- ------ ---------------- ------------
aggr0_netapp_01
           30.06GB    9.46GB   69% online       1 netapp-01        raid_dp,
                                                                   normal
netappSSD       0B        0B    0% restricted   0 netapp-01        raid_dp,
                                                                   normal
2 entries were displayed.

netapp::>

とりあえずonlineできるか確認してみる

netapp::> storage aggregate online -aggregate netappSSD

Error: command failed: Failed to bring aggregate "netappSSD" online. Reason: Neither fsinfo block of aggregate
       'netappSSD' is valid.

netapp::>

オンラインにできない状態であった

エラーの事例を調べると、wafliron で処理をしてみて、ダメだったら、WAFLで問題おきてて、解決方法がないので、バックアップからリストアしろ、とのこと

storage aggregate wafliron のコマンドを使えるように diagモードとして、状態を確認

netapp::> set diag

Warning: These diagnostic commands are for use by NetApp personnel only.
Do you want to continue? {y|n}: y

netapp::*> storage aggregate wafliron show
This table is currently empty.

netapp::*>

wafliron startを実行

netapp::*> storage aggregate wafliron start -aggregate netappSSD

Warning: Aggregate netappSSD is in state "restricted". This aggregate might contain one or more SnapMirror
         destination volumes. You have chosen to skip wafliron on the SnapMirror destination volumes. Do you still
         want to continue? {y|n}: y
Initiated wafliron-start on aggregate "netappSSD".
Monitor the status with the "storage aggregate wafliron show" command.


netapp::*>

開始はされるが、すぐにエラー終了していた

netapp::*> storage aggregate wafliron show
                                                Percent
                                        Percent Summary  Last Last Start
                                         Blocks  Blocks Start Related
Aggregate      State   Current Status   Scanned Scanned Errno Information
-------------- ------- ---------------- ------- ------- ----- ----------------
netappSSD      restricted
                       not_running            -       -   138 Neither fsinfo
                                                              block of
                                                              aggregate
                                                              'netappSSD' is
                                                              valid.

netapp::*>

aggregate showで状態を確認

netapp::*> storage aggregate show


Aggregate     Size Available Used% State   #Vols  Nodes            RAID Status
--------- -------- --------- ----- ------- ------ ---------------- ------------
aggr0_netapp_01
           30.06GB    9.95GB   67% online       1 netapp-01        raid_dp,
                                                                   normal
netappSSD       0B        0B    0% restricted   0 netapp-01        raid_dp,
                                                                   normal
2 entries were displayed.

netapp::*>

onlineを実行したが、状況に変化はなし

netapp::*> storage aggregate online -aggregate netappSSD

Error: command failed: Failed to bring aggregate "netappSSD" online. Reason: Neither fsinfo block of aggregate
       'netappSSD' is valid.

netapp::*>

ということで、対処はできませんでした