Model Scaling

RQ: Does downstream performance exhibit a consistent positive scaling trend with the parameter count of EEG FMs across EEG settings and adaptation strategies?

Full fine-tuning

Each model is evaluated under Full-FT and linear probing (Linear Probe) separately on bipolar and non-bipolar EEG settings, using the same data splits and evaluation protocols.

Bipolar

66%68%70%72%74%76%78%80%82%84%131030100300600Parameters (M, log scale)Average PerformanceSelect HEARHEAR-baseHEAR-base: 4.0M parameters, 75.9% average performance, 8 tasks (40.0% coverage)HEAR-largeHEAR-large: 6.1M parameters, 76.8% average performance, 8 tasks (40.0% coverage)Select LUNALUNA-baseLUNA-base: 7.0M parameters, 79.7% average performance, 20 tasks (100.0% coverage)LUNA-largeLUNA-large: 43.0M parameters, 79.7% average performance, 20 tasks (100.0% coverage)LUNA-hugeLUNA-huge: 311.0M parameters, 79.7% average performance, 20 tasks (100.0% coverage)Select REVEREVE-baseREVE-base: 69.0M parameters, 80.6% average performance, 20 tasks (100.0% coverage)REVE-largeREVE-large: 408.0M parameters, 72.2% average performance, 20 tasks (100.0% coverage)

Non-bipolar

50%55%60%65%70%75%131030100300600Parameters (M, log scale)Average PerformanceSelect HEARHEAR-baseHEAR-base: 4.0M parameters, 61.2% average performance, 59 tasks (70.2% coverage)HEAR-largeHEAR-large: 6.1M parameters, 62.3% average performance, 59 tasks (70.2% coverage)Select LUNALUNA-baseLUNA-base: 7.0M parameters, 65.4% average performance, 84 tasks (100.0% coverage)LUNA-largeLUNA-large: 43.0M parameters, 65.3% average performance, 84 tasks (100.0% coverage)LUNA-hugeLUNA-huge: 311.0M parameters, 55.8% average performance, 84 tasks (100.0% coverage)Select REVEREVE-baseREVE-base: 69.0M parameters, 70.2% average performance, 68 tasks (81.0% coverage)REVE-largeREVE-large: 408.0M parameters, 60.1% average performance, 68 tasks (81.0% coverage)Select ST-EEGFormerST-EEGFormer-smallST-EEGFormer-small: 32.7M parameters, 71.4% average performance, 56 tasks (66.7% coverage)ST-EEGFormer-baseST-EEGFormer-base: 110.9M parameters, 60.7% average performance, 56 tasks (66.7% coverage)ST-EEGFormer-largeST-EEGFormer-large: 328.4M parameters, 54.4% average performance, 55 tasks (65.5% coverage)

Linear probe

Thus, Full-FT evaluates performance after end-to-end adaptation, while Linear Probe provides a more direct assessment of the quality of the pretrained representations with minimal task-specific adaptation.

Bipolar

40%45%50%55%60%65%70%75%80%85%131030100300600Parameters (M, log scale)Average PerformanceSelect HEARHEAR-baseHEAR-base: 4.0M parameters, 71.6% average performance, 8 tasks (40.0% coverage)HEAR-largeHEAR-large: 6.1M parameters, 72.3% average performance, 8 tasks (40.0% coverage)Select LUNALUNA-baseLUNA-base: 7.0M parameters, 70.6% average performance, 20 tasks (100.0% coverage)LUNA-largeLUNA-large: 43.0M parameters, 73.9% average performance, 20 tasks (100.0% coverage)LUNA-hugeLUNA-huge: 311.0M parameters, 76.5% average performance, 20 tasks (100.0% coverage)Select REVEREVE-baseREVE-base: 69.0M parameters, 70.2% average performance, 20 tasks (100.0% coverage)REVE-largeREVE-large: 408.0M parameters, 47.2% average performance, 20 tasks (100.0% coverage)

Non-bipolar

30%35%40%45%50%55%60%65%131030100300600Parameters (M, log scale)Average PerformanceSelect HEARHEAR-baseHEAR-base: 4.0M parameters, 44.3% average performance, 59 tasks (70.2% coverage)HEAR-largeHEAR-large: 6.1M parameters, 43.5% average performance, 59 tasks (70.2% coverage)Select LUNALUNA-baseLUNA-base: 7.0M parameters, 52.3% average performance, 84 tasks (100.0% coverage)LUNA-largeLUNA-large: 43.0M parameters, 55.5% average performance, 84 tasks (100.0% coverage)LUNA-hugeLUNA-huge: 311.0M parameters, 56.8% average performance, 84 tasks (100.0% coverage)Select REVEREVE-baseREVE-base: 69.0M parameters, 58.9% average performance, 68 tasks (81.0% coverage)REVE-largeREVE-large: 408.0M parameters, 45.2% average performance, 68 tasks (81.0% coverage)Select ST-EEGFormerST-EEGFormer-smallST-EEGFormer-small: 32.7M parameters, 44.7% average performance, 56 tasks (66.7% coverage)ST-EEGFormer-baseST-EEGFormer-base: 110.9M parameters, 43.0% average performance, 56 tasks (66.7% coverage)ST-EEGFormer-largeST-EEGFormer-large: 328.4M parameters, 37.1% average performance, 56 tasks (66.7% coverage)

We use the same task-specific evaluation metrics defined in Benchmark Protocol II and conduct the analysis separately for each adaptation strategy and EEG setting.