As Harald says, voice (sound) recognition is pretty well advanced and achieving what you require is certainly possible but not without considerable effort and research/design.
Dual (possibly more) microphones (for direction sensing), audio filtering (to eliminate as many non-required sound...