autointent.advisor.DatasetStats#

class autointent.advisor.DatasetStats#

Minimal stats the advisor needs about the user’s dataset.

Built either from a real Dataset or from CLI placeholder flags.

n_samples: int#
n_classes: int#
avg_tokens: int#
p95_tokens: int | None = None#
multilabel: bool = False#
has_descriptions: bool | None = None#
class_counts: dict[str, int]#
source: str = 'placeholder'#
classmethod placeholder(n_samples=1000, n_classes=10, avg_tokens=32, multilabel=False)#

Build stats for a hypothetical dataset, for sizing a search space without data.

p95_tokens is derived as avg_tokens * 2.5 and class_counts is left empty. Use dataset_stats() instead when a real Dataset is available.

Parameters:
  • n_samples (int) – number of training utterances to assume.

  • n_classes (int) – number of intent classes to assume.

  • avg_tokens (int) – average utterance length in whitespace-separated tokens.

  • multilabel (bool) – whether to assume a multilabel task.

Returns:

Stats with source="placeholder".

Return type:

DatasetStats