我有一个数据集字段为user_idmovieratings用python如何处理能name 用户1 watched_movies 电影A 电影B ratings 4 3这种格式
要将数据集转换为指定的格式,可以按照以下步骤进行处理:
- 导入所需的库:
import pandas as pd
- 读取数据集到一个DataFrame对象:
df = pd.read_csv('your_dataset.csv') # 替换为你的数据集的路径
- 根据用户ID对数据进行分组:
grouped = df.groupby('user_id')
- 创建一个空列表来保存转换后的数据:
result = []
- 遍历每个用户组,提取用户ID、观看的电影和评分,并将其添加到结果列表中:
for user_id, group in grouped:
user_data = {}
user_data['name'] = '用户' + str(user_id) # 假设用户ID为整数
user_data['watched_movies'] = list(group['movie'])
user_data['ratings'] = list(group['ratings'])
result.append(user_data)
- 打印转换后的结果:
print(result)
完整的代码示例如下:
import pandas as pd
df = pd.read_csv('your_dataset.csv') # 替换为你的数据集的路径
grouped = df.groupby('user_id')
result = []
for user_id, group in grouped:
user_data = {}
user_data['name'] = '用户' + str(user_id) # 假设用户ID为整数
user_data['watched_movies'] = list(group['movie'])
user_data['ratings'] = list(group['ratings'])
result.append(user_data)
print(result)
请确保将代码中的'your_dataset.csv'替换为你的实际数据集的路径,并根据实际情况进行调整
原文地址: https://www.cveoy.top/t/topic/izMY 著作权归作者所有。请勿转载和采集!