pzhdfy |
hadoop生态开源贡献者
| 拼车 • pzhdfy 国区 icloud 2T+music 拼车(年/半年/季付)最后一个车位 2025 年 5 月 13 日 |
| 问与答 • pzhdfy chrome 浏览 v2ex, 关闭从列表页点开的新标签页,结果同时关闭新标签页和列表页 2024 年 12 月 2 日 |
| 拼车 • pzhdfy office 365 拼车 ,到期 2027/07/14, 一年 50,两年 80,最后一个车位 2024 年 8 月 30 日 |
| 二手交易 • pzhdfy office 365 拼车 ,到期 2027/07/14, 一年 50,两年 80 2024 年 8 月 28 日 |
| iCloud • pzhdfy 国区 icloud 2T+music 拼车(年/半年/季付) 2023 年 10 月 11 日 • 最后回复来自 pzhdfy | 3 |
| 二手交易 • pzhdfy office 365 拼车 40/人/年,到期 2022/07/14,可 1 年可 2 年 2020 年 7 月 16 日 • 最后回复来自 softliumin110 | 2 |
| 酷工作 • pzhdfy [北京] 快手大数据架构团队急招(欢迎热衷技术,参与开源的小伙伴) 2019 年 10 月 27 日 • 最后回复来自 pzhdfy | 4 |
| 酷工作 • pzhdfy [北京] 快手大数据架构团队持续招人(欢迎热衷技术,开源的小伙伴) 2019 年 3 月 8 日 • 最后回复来自 ffbh | 35 |
| shadowsocks • pzhdfy shadowsocks 官网使用的是 github 证书,什么情况 2015 年 8 月 21 日 • 最后回复来自 breeswish | 1 |
pzhdfy 最近回复了
| 回复了 FeifeiJin 创建的主题 › 超大型文件比较,内存不足,只能分页读区再匹配,但头都秃了,也没想到优化的方式,朋友们帮帮忙啊。2024 年 2 月 18 日 |
这不是大数据经典处理方法吗
将 PersonListA.csv 通过 name hash 拆分为 10 个,PersonListA_1.csv,PersonListA_2.csv...,PersonListA_10.csv (或者更多,每个文件能载入内存就行)
规则是每行数据通过 hash(name)%10 来确定放到哪个文件
将 PersonListB.csv 也是一样的原理,生成 PersonListB_1.csv,PersonListB_2.csv...,PersonListB_10.csv
这样 PersonListA_1.csv 只会根 PersonListB_1.csv 有相同 name 的数据,
所以只需要 10 组文件对比就行
将 PersonListA.csv 通过 name hash 拆分为 10 个,PersonListA_1.csv,PersonListA_2.csv...,PersonListA_10.csv (或者更多,每个文件能载入内存就行)
规则是每行数据通过 hash(name)%10 来确定放到哪个文件
将 PersonListB.csv 也是一样的原理,生成 PersonListB_1.csv,PersonListB_2.csv...,PersonListB_10.csv
这样 PersonListA_1.csv 只会根 PersonListB_1.csv 有相同 name 的数据,
所以只需要 10 组文件对比就行
| 回复了 pzhdfy 创建的主题 › 国区 icloud 2T+music 拼车(年/半年/季付)2023 年 10 月 12 日 |
满了