13.5% faster for 4 elem filters on x86
(extract convolve code to convolveitem, manually increment pointers instead of using indexing)
Authored by: trckjunky 2005-01-02
Parent: [r2603]
Child: [r2605]