mutcleaner.cleaners.rbd_custom_cleaner#

Functions

add_reference_sequences_by_target(dataset, ...)

Attach reference sequences to standardized RBD rows.

mark_wild_type_in_mut_info(dataset[, ...])

Mark wild-type RBD records in the mutation column.

standardize_rbd_target_names(dataset, ...[, ...])

Canonicalize RBD target/reference names.

mutcleaner.cleaners.rbd_custom_cleaner.add_reference_sequences_by_target(dataset, reference_sequences, name_column='name', sequence_column='sequence', fallback_reference_sequence=None)[source]#

Attach reference sequences to standardized RBD rows.

Parameters:
  • dataset (DataFrame) – Input RBD dataset.

  • reference_sequences (Dict[str, str]) – Mapping from target/reference names to RBD reference sequences.

  • name_column (str) – Column containing target/reference names.

  • sequence_column (str) – Output column for reference sequences.

  • fallback_reference_sequence (Optional[str]) – Sequence used when a target/reference name is missing from reference_sequences.

Return type:

DataFrame

Returns:

Dataset with the reference sequence column attached.

mutcleaner.cleaners.rbd_custom_cleaner.mark_wild_type_in_mut_info(dataset, mutation_column='mut_info', variant_class_column='variant_class')[source]#

Mark wild-type RBD records in the mutation column.

Parameters:
  • dataset (DataFrame) – Input RBD dataset.

  • mutation_column (str) – Column containing mutation descriptions.

  • variant_class_column (str) – Column indicating whether a row is wild type.

Return type:

DataFrame

Returns:

Dataset where wild-type rows have mutation_column set to "WT".

mutcleaner.cleaners.rbd_custom_cleaner.standardize_rbd_target_names(dataset, target_name_aliases, name_column='name')[source]#

Canonicalize RBD target/reference names.

Parameters:
  • dataset (DataFrame) – Input RBD dataset.

  • target_name_aliases (Dict[str, str]) – Mapping from alias names to canonical target names.

  • name_column (str) – Column containing the target/reference name.

Return type:

DataFrame

Returns:

Dataset with canonicalized target/reference names.