mutcleaner.cleaners.proteingym_dms_substitutions_custom_cleaners#
Functions
|
Read and combine multiple ProteinGym datasets from a directory or zip file. |
- mutcleaner.cleaners.proteingym_dms_substitutions_custom_cleaners.read_proteingym_dms_substitutions_data(data_path)[source]#
Read and combine multiple ProteinGym datasets from a directory or zip file.
ProteinGym datasets are stored as individual CSV files, one per protein. This function combines them into a single DataFrame for unified processing. Each file contains columns: mutant, mutated_sequence, DMS_score, and various prediction methods.
- Parameters:
data_path (
Union[str,Path]) – Path to directory containing ProteinGym CSV files or path to zip file- Return type:
Tuple[DataFrame,DataFrame]- Returns:
(success_dataframe, failed_dataframe) - successfully processed data and failed file info
- Raises:
FileNotFoundError – If data_path does not exist
ValueError – If no CSV files found or required columns missing
Examples
Process directory of ProteinGym CSV files: >>> success_df, failed_df = read_proteingym_dms_substitutions_data(“DMS_ProteinGym_substitutions/”)
Process zip file: >>> success_df, failed_df = read_proteingym_dms_substitutions_data(“DMS_ProteinGym_substitutions.zip”)