mutcleaner.cleaners.rbd_ace2_cleaner#
Functions
|
Execute the RBD ACE2 cleaning pipeline. |
|
Create the RBD ACE2 cleaning pipeline. |
Classes
|
Configuration for the RBD ACE2 cleaner. |
- class mutcleaner.cleaners.rbd_ace2_cleaner.RBDACE2CleanerConfig(pipeline_name='RBDACE2 pipeline', num_workers=16, validate_config=True, reference_sequences=<factory>, target_name_aliases=<factory>, column_mapping=<factory>, drop_na_columns=<factory>, type_conversions=<factory>, validate_mut_workers=16, process_workers=16, label_columns=<factory>, primary_label_column='label')[source]#
Bases:
BaseCleanerConfigConfiguration for the RBD ACE2 cleaner.
- Attributes:
- reference_sequencesDict[str, str]
Canonical RBD target reference sequences.
- target_name_aliasesDict[str, str]
RBD target alias-to-canonical-name mapping.
- column_mappingDict[str, str]
Mapping from raw source column names to the standardized column names consumed by the RBD ACE2 cleaner.
- validate_mut_workersint
Worker count for mutation validation.
- process_workersint
Worker count for sequence materialization.
- label_columnsList[str]
Label columns retained through the pipeline.
- primary_label_columnstr
Label column written into the final
MutationDataset.- pipeline_namestr
Pipeline name.
Methods
from_dict(config_dict)Create configuration object from dictionary
from_json(json_path)Load configuration from JSON file
get_summary()Get a human-readable summary of the configuration
merge(partial_config)Merge partial configuration with current configuration
to_dict([exclude_callables])Convert configuration to dictionary
to_json(json_path, **json_kwargs)Save configuration to JSON file
validate()Validate RBD ACE2 cleaner configuration values.
- column_mapping: Dict[str, str]#
- drop_na_columns: List[str]#
- label_columns: List[str]#
- pipeline_name: str = 'RBDACE2 pipeline'#
- primary_label_column: str = 'label'#
- process_workers: int = 16#
- reference_sequences: Dict[str, str]#
- target_name_aliases: Dict[str, str]#
- type_conversions: Dict[str, str]#
- validate()[source]#
Validate RBD ACE2 cleaner configuration values.
- Raises:
ValueError – If the configuration is internally inconsistent.
- Return type:
None
- validate_mut_workers: int = 16#
- mutcleaner.cleaners.rbd_ace2_cleaner.clean_rbd_ace2_dataset(pipeline)[source]#
Execute the RBD ACE2 cleaning pipeline.
- Parameters:
pipeline (
Pipeline) – Pipeline created bycreate_rbd_ace2_cleaner().- Return type:
Tuple[Pipeline,MutationDataset]- Returns:
Executed pipeline and cleaned mutation dataset.
- mutcleaner.cleaners.rbd_ace2_cleaner.create_rbd_ace2_cleaner(dataset_or_path=None, config=None)[source]#
Create the RBD ACE2 cleaning pipeline.
- Parameters:
dataset_or_path (
Union[DataFrame,str,Path,None]) – Raw RBD ACE2 dataframe or input file path.config (
Union[RBDACE2CleanerConfig,Dict[str,Any],str,Path,None]) – Cleaner configuration object, partial configuration dictionary, JSON path, orNoneto use the built-in default configuration.
- Return type:
- Returns:
Delayed cleaning pipeline.
- Raises:
TypeError – If
dataset_or_pathorconfiguses an unsupported type.