Dataset Viewer
Duplicate
The dataset viewer is not available for this split.
Cannot load the dataset split (in streaming mode) to extract the first rows.
Error code:   StreamingRowsError
Exception:    CastError
Message:      Couldn't cast
@context: struct<@language: string, @vocab: string, sc: string, cr: string, dct: string, rai: string, citeAs:  (... 615 chars omitted)
  child 0, @language: string
  child 1, @vocab: string
  child 2, sc: string
  child 3, cr: string
  child 4, dct: string
  child 5, rai: string
  child 6, citeAs: string
  child 7, column: string
  child 8, conformsTo: string
  child 9, data: struct<@id: string, @type: string>
      child 0, @id: string
      child 1, @type: string
  child 10, dataType: struct<@id: string, @type: string>
      child 0, @id: string
      child 1, @type: string
  child 11, equivalentProperty: string
  child 12, examples: struct<@id: string, @type: string>
      child 0, @id: string
      child 1, @type: string
  child 13, extract: string
  child 14, field: string
  child 15, fileObject: string
  child 16, fileProperty: string
  child 17, fileSet: string
  child 18, format: string
  child 19, samplingRate: string
  child 20, includes: string
  child 21, isLiveDataset: string
  child 22, jsonPath: string
  child 23, key: string
  child 24, md5: string
  child 25, parentField: string
  child 26, path: string
  child 27, recordSet: string
  child 28, references: string
  child 29, regex: string
  child 30, repeated: string
  child 31, replace: string
  child 32, separator: string
  child 33, source: string
  child 34, subField: string
  child 35, transform: string
@type: string
name: string
description: string
url: string
sameAs: string
license: string
conformsTo: 
...
e: string, @id: string, name: string, description: string, dataType: string, source: stru (... 120 chars omitted)
              child 0, @type: string
              child 1, @id: string
              child 2, name: string
              child 3, description: string
              child 4, dataType: string
              child 5, source: struct<fileSet: struct<@id: string>, extract: struct<fileProperty: string>, transform: struct<regex: (... 9 chars omitted)
                  child 0, fileSet: struct<@id: string>
                      child 0, @id: string
                  child 1, extract: struct<fileProperty: string>
                      child 0, fileProperty: string
                  child 2, transform: struct<regex: string>
                      child 0, regex: string
              child 6, value: int64
rai:dataCollection: string
rai:dataCollectionType: string
rai:dataCollectionTimeframe: string
rai:dataCollectionMissingData: string
rai:dataAnnotationProtocol: string
rai:dataUseCases: list<item: string>
  child 0, item: string
rai:dataLimitations: list<item: string>
  child 0, item: string
rai:dataBiases: list<item: string>
  child 0, item: string
rai:dataSocialImpact: string
rai:personalSensitiveInformation: string
rai:dataReleaseMaintenancePlan: string
rates_dt: list<item: double>
  child 0, item: double
t_phys: double
instances_per_cell: int64
families: list<item: string>
  child 0, item: string
identifiability: bool
excitations: list<item: string>
  child 0, item: string
to
{'families': List(Value('string')), 'excitations': List(Value('string')), 'rates_dt': List(Value('float64')), 't_phys': Value('float64'), 'instances_per_cell': Value('int64'), 'identifiability': Value('bool')}
because column names don't match
Traceback:    Traceback (most recent call last):
                File "/src/services/worker/src/worker/utils.py", line 147, in get_rows_or_raise
                  return get_rows(
                      dataset=dataset,
                  ...<4 lines>...
                      column_names=column_names,
                  )
                File "/src/libs/libcommon/src/libcommon/utils.py", line 272, in decorator
                  return func(*args, **kwargs)
                File "/src/services/worker/src/worker/utils.py", line 127, in get_rows
                  rows_plus_one = list(itertools.islice(safe_iter(ds, dataset=dataset), rows_max_number + 1))
                File "/src/services/worker/src/worker/utils.py", line 478, in safe_iter
                  yield from ds.decode(False) if ds.features else ds
                File "/usr/local/lib/python3.14/site-packages/datasets/iterable_dataset.py", line 2818, in __iter__
                  for key, example in ex_iterable:
                                      ^^^^^^^^^^^
                File "/usr/local/lib/python3.14/site-packages/datasets/iterable_dataset.py", line 2355, in __iter__
                  for key, pa_table in self._iter_arrow():
                                       ~~~~~~~~~~~~~~~~^^
                File "/usr/local/lib/python3.14/site-packages/datasets/iterable_dataset.py", line 2380, in _iter_arrow
                  for key, pa_table in self.ex_iterable._iter_arrow():
                                       ~~~~~~~~~~~~~~~~~~~~~~~~~~~~^^
                File "/usr/local/lib/python3.14/site-packages/datasets/iterable_dataset.py", line 536, in _iter_arrow
                  for key, pa_table in iterator:
                                       ^^^^^^^^
                File "/usr/local/lib/python3.14/site-packages/datasets/iterable_dataset.py", line 419, in _iter_arrow
                  for key, pa_table in self.generate_tables_fn(**gen_kwags):
                                       ~~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^
                File "/usr/local/lib/python3.14/site-packages/datasets/packaged_modules/json/json.py", line 343, in _generate_tables
                  self._cast_table(pa_table, json_field_paths=json_field_paths),
                  ~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
                File "/usr/local/lib/python3.14/site-packages/datasets/packaged_modules/json/json.py", line 132, in _cast_table
                  pa_table = table_cast(pa_table, self.info.features.arrow_schema)
                File "/usr/local/lib/python3.14/site-packages/datasets/table.py", line 2369, in table_cast
                  return cast_table_to_schema(table, schema)
                File "/usr/local/lib/python3.14/site-packages/datasets/table.py", line 2297, in cast_table_to_schema
                  raise CastError(
                  ...<3 lines>...
                  )
              datasets.table.CastError: Couldn't cast
              @context: struct<@language: string, @vocab: string, sc: string, cr: string, dct: string, rai: string, citeAs:  (... 615 chars omitted)
                child 0, @language: string
                child 1, @vocab: string
                child 2, sc: string
                child 3, cr: string
                child 4, dct: string
                child 5, rai: string
                child 6, citeAs: string
                child 7, column: string
                child 8, conformsTo: string
                child 9, data: struct<@id: string, @type: string>
                    child 0, @id: string
                    child 1, @type: string
                child 10, dataType: struct<@id: string, @type: string>
                    child 0, @id: string
                    child 1, @type: string
                child 11, equivalentProperty: string
                child 12, examples: struct<@id: string, @type: string>
                    child 0, @id: string
                    child 1, @type: string
                child 13, extract: string
                child 14, field: string
                child 15, fileObject: string
                child 16, fileProperty: string
                child 17, fileSet: string
                child 18, format: string
                child 19, samplingRate: string
                child 20, includes: string
                child 21, isLiveDataset: string
                child 22, jsonPath: string
                child 23, key: string
                child 24, md5: string
                child 25, parentField: string
                child 26, path: string
                child 27, recordSet: string
                child 28, references: string
                child 29, regex: string
                child 30, repeated: string
                child 31, replace: string
                child 32, separator: string
                child 33, source: string
                child 34, subField: string
                child 35, transform: string
              @type: string
              name: string
              description: string
              url: string
              sameAs: string
              license: string
              conformsTo: 
              ...
              e: string, @id: string, name: string, description: string, dataType: string, source: stru (... 120 chars omitted)
                            child 0, @type: string
                            child 1, @id: string
                            child 2, name: string
                            child 3, description: string
                            child 4, dataType: string
                            child 5, source: struct<fileSet: struct<@id: string>, extract: struct<fileProperty: string>, transform: struct<regex: (... 9 chars omitted)
                                child 0, fileSet: struct<@id: string>
                                    child 0, @id: string
                                child 1, extract: struct<fileProperty: string>
                                    child 0, fileProperty: string
                                child 2, transform: struct<regex: string>
                                    child 0, regex: string
                            child 6, value: int64
              rai:dataCollection: string
              rai:dataCollectionType: string
              rai:dataCollectionTimeframe: string
              rai:dataCollectionMissingData: string
              rai:dataAnnotationProtocol: string
              rai:dataUseCases: list<item: string>
                child 0, item: string
              rai:dataLimitations: list<item: string>
                child 0, item: string
              rai:dataBiases: list<item: string>
                child 0, item: string
              rai:dataSocialImpact: string
              rai:personalSensitiveInformation: string
              rai:dataReleaseMaintenancePlan: string
              rates_dt: list<item: double>
                child 0, item: double
              t_phys: double
              instances_per_cell: int64
              families: list<item: string>
                child 0, item: string
              identifiability: bool
              excitations: list<item: string>
                child 0, item: string
              to
              {'families': List(Value('string')), 'excitations': List(Value('string')), 'rates_dt': List(Value('float64')), 't_phys': Value('float64'), 'instances_per_cell': Value('int64'), 'identifiability': Value('bool')}
              because column names don't match

Need help to make the dataset viewer work? Make sure to review how to configure the dataset viewer, and open a discussion for direct support.

PLANTFORGE corpus

A procedural control-plant corpus for in-context system identification, organized along three axes jointly: nonlinearity family × excitation class × sampling rate (exact ZOH), with per-instance Fisher-information identifiability annotations.

Code, generator, training/evaluation pipeline, and full documentation: https://github.com/Soarr01/plantforge (see docs/DATASHEET.md there for the full Datasheet-for-Datasets writeup this card summarizes).

Quick facts

  • 240,000 instances: 5 families × 4 excitations × 3 rates × 4000 instances/cell.
  • Families: stribeck (velocity friction) · backlash (input deadzone) · saturate (input clipping) · boucwen (output hysteresis) · drivetrain (two-inertia motor/gear/compliant-load).
  • Excitations: prbs · multisine · chirp · closedloop (true sequential PI loop, not a two-pass imitation).
  • Rates: 10 / 20 / 50 Hz, exact zero-order-hold from one shared continuous-time truth per instance (state-nonlinear families substep internally so dt and dt/4 agree at common instants).
  • Ground truth: named physical parameters per instance, no hidden normalization (verified: re-simulation from θ reproduces y to 1e-6).
  • Identifiability annotations: per-parameter relative Cramér-Rao lower bound and FIM log10-condition-number, per (instance, excitation, rate). Note an honest caveat from the release experiments: these annotations do not positively predict in-context prediction difficulty (within-cell median Spearman r ≈ −0.12 against per-instance prediction nMSE, robust to confound controls) — parameter-recovery difficulty decouples from prediction difficulty. They are intended as metadata for excitation-design and identifiability studies, not as a difficulty score.

Format

60 shard files ({family}_{excitation}_dt{rate}hz.pt, PyTorch tensor dicts), plus registry.json. Each shard:

import torch
shard = torch.load("stribeck_multisine_dt50hz.pt")
shard["u"], shard["y"]          # (T, B) input/output trajectories
shard["theta"]                  # (B, K) named physical parameters
shard["keys"]                   # length-K parameter names
shard["rel_crlb"]               # (B, K) per-parameter relative CRLB
shard["log10_cond"]             # (B,) log10 FIM condition number
shard["dt"], shard["family"], shard["excitation"]   # shard metadata

License

CC BY 4.0 — see LICENSE-DATA in the code repository, or https://creativecommons.org/licenses/by/4.0/. Attribution: cite the code repository (https://github.com/Soarr01/plantforge) and this dataset.

Citation

<BibTeX — TBD, pending paper draft>

Downloads last month
46