mutcleaner.cleaners.rbd_ace2_cleaner#

Functions

clean_rbd_ace2_dataset(pipeline)

Execute the RBD ACE2 cleaning pipeline.

create_rbd_ace2_cleaner([dataset_or_path, ...])

Create the RBD ACE2 cleaning pipeline.

Classes

RBDACE2CleanerConfig([pipeline_name, ...])

Configuration for the RBD ACE2 cleaner.

class mutcleaner.cleaners.rbd_ace2_cleaner.RBDACE2CleanerConfig(pipeline_name='RBDACE2 pipeline', num_workers=16, validate_config=True, reference_sequences=<factory>, target_name_aliases=<factory>, column_mapping=<factory>, drop_na_columns=<factory>, type_conversions=<factory>, validate_mut_workers=16, process_workers=16, label_columns=<factory>, primary_label_column='label')[source]#

Bases: BaseCleanerConfig

Configuration for the RBD ACE2 cleaner.

Attributes:
reference_sequencesDict[str, str]

Canonical RBD target reference sequences.

target_name_aliasesDict[str, str]

RBD target alias-to-canonical-name mapping.

column_mappingDict[str, str]

Mapping from raw source column names to the standardized column names consumed by the RBD ACE2 cleaner.

validate_mut_workersint

Worker count for mutation validation.

process_workersint

Worker count for sequence materialization.

label_columnsList[str]

Label columns retained through the pipeline.

primary_label_columnstr

Label column written into the final MutationDataset.

pipeline_namestr

Pipeline name.

Methods

from_dict(config_dict)

Create configuration object from dictionary

from_json(json_path)

Load configuration from JSON file

get_summary()

Get a human-readable summary of the configuration

merge(partial_config)

Merge partial configuration with current configuration

to_dict([exclude_callables])

Convert configuration to dictionary

to_json(json_path, **json_kwargs)

Save configuration to JSON file

validate()

Validate RBD ACE2 cleaner configuration values.

column_mapping: Dict[str, str]#
drop_na_columns: List[str]#
label_columns: List[str]#
pipeline_name: str = 'RBDACE2 pipeline'#
primary_label_column: str = 'label'#
process_workers: int = 16#
reference_sequences: Dict[str, str]#
target_name_aliases: Dict[str, str]#
type_conversions: Dict[str, str]#
validate()[source]#

Validate RBD ACE2 cleaner configuration values.

Raises:

ValueError – If the configuration is internally inconsistent.

Return type:

None

validate_mut_workers: int = 16#
mutcleaner.cleaners.rbd_ace2_cleaner.clean_rbd_ace2_dataset(pipeline)[source]#

Execute the RBD ACE2 cleaning pipeline.

Parameters:

pipeline (Pipeline) – Pipeline created by create_rbd_ace2_cleaner().

Return type:

Tuple[Pipeline, MutationDataset]

Returns:

Executed pipeline and cleaned mutation dataset.

mutcleaner.cleaners.rbd_ace2_cleaner.create_rbd_ace2_cleaner(dataset_or_path=None, config=None)[source]#

Create the RBD ACE2 cleaning pipeline.

Parameters:
  • dataset_or_path (Union[DataFrame, str, Path, None]) – Raw RBD ACE2 dataframe or input file path.

  • config (Union[RBDACE2CleanerConfig, Dict[str, Any], str, Path, None]) – Cleaner configuration object, partial configuration dictionary, JSON path, or None to use the built-in default configuration.

Return type:

Pipeline

Returns:

Delayed cleaning pipeline.

Raises:

TypeError – If dataset_or_path or config uses an unsupported type.