2011年10月15日 星期六

2011-10-15

IMAG0428

吃飯時候同行人提議說如果有個可以拆帳單的軟體說不定會很好用?我想了一想,如果還要手動輸入每個項目的話,那就每個人自己用計算機按一按還比較快。接著就想進階一點,如果用OCR直接拍一張帳單照片,再用選擇哪樣東西屬於哪個人的方式去分帳單也許會比較快?一開始很興奮的想看看要怎麼做,不過後來查一下,原來iPhone已經有點子一樣的Bill Split OCR了,而且效果看起來還不錯 囧rz。

不過查了一查Android上面並沒有類似的東西,接著就看看Android上面有什麼可以用的現成OCR Library。在stackoverflow上面提到的tesjeractmezzofanti都是tesseract的Android移植版,所以就先抓電腦版的tesseract來試試看(然後想到這個也是sikuli裡面用的OCR Library)。把標題的那張帳單轉灰階拿去餵給tesseract得到的結果如下(最前面是行號)

1 f ' *.:.®¢,¢-wé»a';;_ ~   ;. -.=.     -+1   if .» , .. - , _ A     .  
) __-;_<_.,~. '_ ¢,;.;. M., 1. » _Z 1-, - -'4 _fp r- ;-K., _,. 5* ~. I; _‘   _'» .A 'V _'j 
E, f ,e _1__5.,1__i°`g§§5-gf? Q-,_:.,_` _y.:j{`__ ,.~_.-_.xt».'.“,»\~Y__»Ni; ._ .1 _.ak/'v@,Iy»K, ‘_ `     _i' Y__44~_,‘ 1_§,_;; `_v._ ._ ‘_ N; v ,X 
.1 V. V ,_ ` _,g .,'§y,_ -.15 _, g - f_   § .:__..   _ -\.',_A __<.1,--"-_}.   >‘- _" ,_.~~ -»'- ,f-,.'    __     »=\ IQ, 
~,' » ~f.‘-g~}.-ew*-“   ‘aff':-~'f_g,.;3g -5 'f‘-mn .‘ " » ,;-fr,   :YW :.~_\»~»'fffl"' "p f~_-1 -§"_>’    ~ <<=,_;2:P"$'f - ?ff!fff vi 
[la '~_ _,_ . ,_-_,¢_‘=»;v{F*~\,,}. .AA-,Vg ,\ » .   ,Q   ,-{__, .. *an _~ If »‘_  ~# 'mp-._ _.Y .fr        an, ., fr., 
‘1*" '=~~=»7 lf;c         ' f~,_     _- _.a  “al 1- ’» ,; \  » 1  
'l» -1  5; `   w.  rv     31 ? .     . 
lim   Q;   _»     e-  _ _  ~  _ _  _    ~» 
3.- _  1_¢.'is  _   2 f f.  _ ‘   _~,.;, _ ,egay.“’g1;;-f=¥4;:,.<\e~a;]§f*§?';,¢f-;?w§2~F   4* 
4 _ 1513>   ‘ ' f-.»~._ v~-'al u .' = .~..a1~»?`,;~‘Ef' lu.-;, Aww. of-_  " 
ji 'L_ ___;.. :K  ,‘. .Fe 1. sr-_N ~¢_ ,_,_., 
,  . _ _ ~_ "fair . f E- R jr*    aw;  __ "»1",$___‘1{@- 4 2" s*~»"   ' ‘ 
.,,¢.g. .1- _-fu:/.,» » __ _   _ ., .L . _ 
_,  V Wi_iv 
» -1--- 

!l 

11 
DiHiNQ Q
ii lil ' 
Boba Cafe 
_ 5131 Freeport Blvd. 
Sacramento,CA 
6 5. A Phone(916)455-1687 
oare=1oEl_l§._§o1°l" Time: 01:22PM g 
Server: gary 7
Bill: 128559 lable : 14 1 
3 Tapioca MT 8.25 ' 
1 Milk lea 2.50 ` 
3 Noodle w/ Meat 18.75 ‘ 
1 Noodle 4.55 
1 Szechuan Wonton 4.00 
1 Calamari 3.95 E 
Subtotal 42.00 5 
._   Sale_Tax    3.25  §

f”fe"iféf"'*‘*°'a* ""'° “ "*"° """'   "" 5 
T@¥@l__  45-25 z
-.¢¢§% §&e?$g£;%f-_ 11.1 ,_ »1;g*.M§ 
Q 5-. _       -».#f:f.»- , , ._ ._ 
V Ja-   .Lfv   _ " _ iv time *_ 1; _ 1. ` Ii, _ V -‘~. : A; .I ` v ` R. I' r__L'_.v': _}i!;,`\_ ,_-_.Y     ‘f 
_, _  Ay .__.;.qu, _ 
ff ‘“"5§ f`¢fff ‘ _ _ro ,  ariwg; 
QI; ' 'Kr  ‘ `» af-  .1 f~ Q.. 
. ,., .-,Aa~§" 'P . 
¢';‘\4-_;"»_:-v - 
_». -J_. 
\~ . 
_v, 
., _ _ _ _ 
f _15 ‘1_ __§__ _  ~ _» ...V E 
f_-fc _   .{.;,~»_,¢‘\», 
*.>f<~, ' ,;;*é21.;f:‘5v2 -**"‘ 
A; Cx 1 §,)?{f`5_ié»; .fwxwlig '

嗯....怎麼效果這麼爛雜訊這麼多...是因為輸入的影像沒有做什麼處理嗎?我還以為純英文印刷體OCR是很成熟的技術了....

沒有留言: