我正在使用研究数据导入Pandas数据框read_csv
.
我的主题代码是6个数字编码,其中包括出生日期.对于我的一些主题,这导致具有前导零的代码(例如"010816").
当我导入Pandas时,前导零被剥离,列被格式化为int64
.
有没有办法可以将此列导入为字符串?
我尝试为列使用自定义转换器,但它不起作用 - 好像自定义转换发生在Pandas转换为int之前.
我有一个带字母数字键的数据框,我想将其保存为csv并稍后再读回.由于各种原因,我需要明确地将此键列作为字符串格式读取,我有严格数字或更糟糕的键,如:1234E5,Pandas将其解释为浮点数.这显然使得密钥完全没用.
问题是,当我为数据框或其任何列指定字符串dtype时,我只是回垃圾.我在这里有一些示例代码:
df = pd.DataFrame(np.random.rand(2,2),
index=['1A', '1B'],
columns=['A', 'B'])
df.to_csv(savefile)
Run Code Online (Sandbox Code Playgroud)
数据框看起来像:
A B
1A 0.209059 0.275554
1B 0.742666 0.721165
Run Code Online (Sandbox Code Playgroud)
然后我就这样读了:
df_read = pd.read_csv(savefile, dtype=str, index_col=0)
Run Code Online (Sandbox Code Playgroud)
结果是:
A B
B ( <
Run Code Online (Sandbox Code Playgroud)
这是我的电脑的问题,或者我在这里做错了什么,或者只是一个错误?
所以我正在阅读NOAA的电台代码csv文件,如下所示:
"USAF","WBAN","STATION NAME","CTRY","FIPS","STATE","CALL","LAT","LON","ELEV(.1M)","BEGIN","END"
"006852","99999","SENT","SW","SZ","","","+46817","+010350","+14200","",""
"007005","99999","CWOS 07005","","","","","-99999","-999999","-99999","20120127","20120127"
Run Code Online (Sandbox Code Playgroud)
前两列包含气象站的代码,有时它们有前导零.当pandas在没有指定dtype的情况下导入它们时,它们会变成整数.这并不是什么大不了的事,因为我可以遍历数据框索引并用类似的东西替换它们,"%06d" % i
因为它们总是六位数,但是你知道......这就是懒人的方式.
使用以下代码获取csv:
file = urllib.urlopen(r"ftp://ftp.ncdc.noaa.gov/pub/data/inventories/ISH-HISTORY.CSV")
output = open('Station Codes.csv','wb')
output.write(file.read())
output.close()
Run Code Online (Sandbox Code Playgroud)
这一切都很好,但当我去尝试阅读它使用这个:
import pandas as pd
df = pd.io.parsers.read_csv("Station Codes.csv",dtype={'USAF': np.str, 'WBAN': np.str})
Run Code Online (Sandbox Code Playgroud)
要么
import pandas as pd
df = pd.io.parsers.read_csv("Station Codes.csv",dtype={'USAF': str, 'WBAN': str})
Run Code Online (Sandbox Code Playgroud)
我收到一条令人讨厌的错误消息:
File "C:\Python27\lib\site-packages\pandas-0.11.0-py2.7-win32.egg\pandas\io\parsers.py", line 401, in parser
_f
return _read(filepath_or_buffer, kwds)
File "C:\Python27\lib\site-packages\pandas-0.11.0-py2.7-win32.egg\pandas\io\parsers.py", line 216, in _read
return parser.read()
File "C:\Python27\lib\site-packages\pandas-0.11.0-py2.7-win32.egg\pandas\io\parsers.py", line 633, in read
ret = self._engine.read(nrows)
File "C:\Python27\lib\site-packages\pandas-0.11.0-py2.7-win32.egg\pandas\io\parsers.py", line 957, in read
data …
Run Code Online (Sandbox Code Playgroud) 从txt文件读取数据后,有一个如下所示的数据帧(df1):
name l1 l2
a 00000 00000
b 00010 00002
c 00000 01218
Run Code Online (Sandbox Code Playgroud)
当我如下使用python代码时:
dataframe.to_csv('test.csv', index= False)
Run Code Online (Sandbox Code Playgroud)
然后,我使用以下代码来阅读:
df = pd.read_csv('test.csv')
Run Code Online (Sandbox Code Playgroud)
我发现数据框如下所示是df2
name l1 l2
a 0 0
b 10 2
c 0 1218
Run Code Online (Sandbox Code Playgroud)
但是我想像df1一样在数据帧中保留前导零。
谢谢!
我有这个txt文件:
Tu 11:44:00 119 52913161 DETECTOR STATE 0001
Tu 11:44:00 119 52913161 DETECTOR STATE 1100
Tu 11:44:02 119 52913161 DETECTOR STATE 0000
Tu 11:44:02 119 52913161 DETECTOR STATE 1110
Tu 11:44:04 119 52913161 DETECTOR STATE 0000
Tu 11:44:04 119 52913161 DETECTOR STATE 0011
Run Code Online (Sandbox Code Playgroud)
我使用以下代码在 Python(Jupyter Notebook)中打开:
import pandas as pd
data= pd.read_csv('EXPORT20171205114501_1.txt', sep=" ", header=None)
data.columns = ["day", "time", "street", "sensor", "type", "state", "bits"]
Run Code Online (Sandbox Code Playgroud)
我得到这个输出:
day time street sensor type state bits
0 Tu 11:44:00 119 52913161 DETECTOR STATE 1 …
Run Code Online (Sandbox Code Playgroud) pandas ×5
python ×4
csv ×2
dataframe ×2
import-csv ×1
leading-zero ×1
python-2.7 ×1
string ×1
text-files ×1
types ×1