pythondataframe纵向合并_PythonDataframe合并问题--688IT编程网

pythondataframe纵向合并_PythonDataframe合并问题⽤Pandas读取⼀个七百万条记录的微博爬⾍⽂件，⼤⼩约1G。直接读⼊内存不⾜，于是采⽤chunksize=100000来分批读取。每个chunk的数据处理后得到count长这样：

daysCount tweetsSum

userID

1294588034 5 305

2277435630 4 284

1985258823 6 265

1886370740 7 265

... ... ...

之后我尝试把这些dataframe合并，代码如下：

count_list=[]

for chunk in data:

...

count_list.append(count)

total_count = pd.concat(count_list, axis=0)

print(total_count.sort_value(by=['tweetsSum'],ascending=False))

结果发现汇总后的数据总是⼩于真正的数据量，不管是daysCount还是tweetsSum都是。⽽且调⾼chunksize，这两个值也会提⾼。python新手代码userid

于是我猜想在concat的时候，遇到userID相同的，它只会取daysCount和tweetsSum的最⼤值，⽽不是值相加。

如果是这样的问题的话，那么该怎么合并dataframe，能让碰到userID相同的时候，让daysCount和tweetsSum相加呢？

发表评论

688IT编程网

pythondataframe纵向合并_PythonDataframe合并问题

发表评论

推荐文章

java正则表达式选择题

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

工龄小数点提取

非零金额正则表达式

提取文本中数字的函数

热门文章

利用正则表达式实现文本数据提取与处理

正则表达式零宽断言详解

文本匹配规则

excel中使用正则

1-31正则表达式

anki之高级筛选

BUAA_OO_2021_第一单元总结

insert语句递增写法

sublime text 3在行前插入递增数字序号的方法

字符串只允许数字和英文的正则

powerbuilder 正则表达式

Shell脚本编写的高级技巧利用正则表达式进行字符串匹配

JAVA正则表达式的三种模式:贪婪,勉强和占有的讨论

go regexp匹配规则

oracle regexp_substr 实现原理

基本的元字符回溯引用和前后查匹配模式

elasticsearch query dsl正则

oracle sql正则表达式

GA-设置目标

仅匹配全角片假名的正则表达式

最新文章

java正则表达式选择题

工龄小数点提取

非零金额正则表达式

提取文本中数字的函数

vue数字相加小数点变长-概述说明以及解释

vue validate 正则验证小数长度

标签列表

688IT编程网

pythondataframe纵向合并_PythonDataframe合并问题

发表评论

推荐文章

java正则表达式 选择题

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

工龄小数点提取

非零金额 正则表达式

提取文本中数字的函数

热门文章

利用正则表达式实现文本数据提取与处理

正则表达式零宽断言详解

文本匹配规则

excel中使用正则

1-31正则表达式

anki之高级筛选

BUAA_OO_2021_第一单元总结

insert语句递增写法

sublime text 3在行前插入递增数字序号的方法

字符串只允许数字和英文的正则

powerbuilder 正则表达式

Shell脚本编写的高级技巧利用正则表达式进行字符串匹配

JAVA正则表达式的三种模式:贪婪,勉强和占有的讨论

go regexp匹配规则

oracle regexp_substr 实现原理

基本的元字符 回溯引用和前后查 匹配模式

elasticsearch query dsl正则

oracle sql正则表达式

GA-设置目标

仅匹配全角片假名的正则表达式

最新文章

java正则表达式 选择题

工龄小数点提取

非零金额 正则表达式

提取文本中数字的函数

vue数字相加小数点变长-概述说明以及解释

vue validate 正则验证小数长度

标签列表

java正则表达式选择题

非零金额正则表达式

基本的元字符回溯引用和前后查匹配模式

java正则表达式选择题

非零金额正则表达式